CATALOG

Models

Find the right model by capability, context and price. Compare options or try one in Chat.

Output / endpointExact metadata
24 of 646 modelsReference token prices are per million tokens.
Audio input

Gemini 3.5 Transcribe is a speech-to-text model from Google. It is suited for synchronous transcription that needs word-level timestamps or speaker diarization, with support for up to eight speakers. Audio...

by googleSep 25, 202698.3K contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Transcribe 1 Pro is a speech-to-text model from Fish Audio tuned for interviews, meetings, and podcasts. It labels speakers with inline `speaker` markers, preserves emotion and vocal-event cues such as...

by fish-audioSep 24, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Universal-3.5 Pro is AssemblyAI's speech-to-text model served through its Sync API, returning a complete transcript with word-level timestamps in a single synchronous response for audio clips up to 120 seconds....

by assemblyaiSep 22, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Muse Voice Transcribe 1.0 is a synchronous speech-to-text model from Meta. It is suited for push-to-talk, endpointing, and speaker-aware transcription, with keyword biasing for domain terms and language biasing through...

by metaSep 11, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

MAI-Transcribe 2 is a multilingual speech-to-text model from Microsoft AI, ranked #1 on the FLEURS multilingual benchmark. It supports 60 languages with automatic language identification, code switching for mixed-language speech,...

by microsoftSep 3, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Qwen3 ASR 1.7B is an automatic speech recognition model from Qwen. It supports multilingual language identification and transcription across 30 languages and 22 Chinese dialects, with streaming and offline inference...

by qwenAug 13, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Qwen3 ASR 0.6B is a compact automatic speech recognition model from Qwen. It supports multilingual language identification and transcription across 30 languages and 22 Chinese dialects, with streaming and offline...

by qwenAug 13, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

GPT Transcribe is a high-accuracy speech-to-text model from OpenAI. It is suited for recorded audio, streamed file transcription, and committed Realtime turns, with free-form context, keyword hints, and multiple language...

by openaiAug 5, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Transcribe 1 is a speech-to-text model from Fish Audio. It is suited for audio transcription with automatic language detection and can return timestamped word-level segments when alignment details are requested.

by fish-audioJul 29, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Grok STT is SpaceXAI's speech-to-text model, available via the REST /v1/stt endpoint. It supports transcription with word-level timestamps, optional speaker diarization, and multichannel audio.

by x-aiJul 23, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Deepgram Nova-3 general-purpose speech-to-text model with monolingual and multilingual transcription support.

by deepgramJul 15, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

MAI-Transcribe 1.5 is a multilingual speech-to-text model from Microsoft AI. It is suited for captions, call transcription, subtitling, accessibility, and other voice-enabled applications, with reliable transcription across 43 languages, diverse...

by microsoftJun 2, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Parakeet TDT 0.6B v3 is NVIDIA's 600M-parameter multilingual speech-to-text model built on the FastConformer-TDT architecture. Trained on the Granary dataset (670,000+ hours of audio), it supports automatic language detection across...

by nvidiaMay 27, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Voxtral Mini Transcribe is Mistral's speech-to-text model, derived from the Voxtral Mini family. It accepts audio input and returns transcribed text via the standard transcription API. Suited for transcribing meetings,...

by mistralaiMay 15, 202616.38K contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Qwen3-ASR-Flash is Alibaba's automatic speech recognition service, built on the Qwen3-Omni foundation and trained on tens of millions of hours of multimodal speech data. The model handles 11 languages —...

by qwenMay 14, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Chirp 3 is Google's latest multilingual speech-to-text model. It offers enhanced transcription accuracy across 24 GA languages and 77+ preview languages, with support for automatic language detection, automatic punctuation, and...

by googleMay 5, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

GPT-4o Mini Transcribe is OpenAI's smaller, cost-efficient speech-to-text model built on GPT-4o Mini audio capabilities. It's priced per token (input and output), making it suitable for high-volume transcription workflows that...

by openaiMay 1, 2026128K contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Whisper Large V3 is OpenAI's open-source automatic speech recognition model offering both audio transcription and translation. It supports 99+ languages and accepts common audio formats including mp3, mp4, wav, webm,...

by openaiMay 1, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Whisper Large V3 Turbo is an optimized version of OpenAI's Whisper Large V3 speech recognition model, designed for speed and cost efficiency. It supports transcription across 99+ languages with a...

by openaiMay 1, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

Whisper is OpenAI's open-source automatic speech recognition model, available via API as `whisper-1`. It supports transcription and translation across 50+ languages from audio files up to 25 MB. Accepts formats...

by openaiApr 27, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
Audio input

GPT-4o Transcribe is OpenAI's high-quality speech-to-text model built on GPT-4o audio capabilities. It's priced per token (input and output), making it suitable for workflows that benefit from token-level billing transparency.

by openaiApr 27, 2026128K contextSpecialized media pricing · open model detailsAudio → Transcription