CATALOG

Models

Find the right model by capability, context and price. Compare options or try one in Playground.

Output / endpointExact metadata
64 of 599 modelsReference token prices are per million tokens.
VisionVideo inputToolsReasoning

Qwen3.8 Max 0902 is an updated snapshot of Qwen3.8 Max from Alibaba's Qwen team. It is a 2.4-trillion-parameter mixture-of-experts model that accepts text, image, and video input and returns text,...

by qwenSep 3, 20261M context$2/M input$6/M outputText, Image, VideoText
VisionVideo inputToolsReasoning

Qwen3.8 Flash is a multimodal reasoning model from Alibaba. It is suited for coding assistance, agentic workflows, visual understanding, document and codebase analysis, desktop interaction, chart analysis, and long-video analysis.

by qwenAug 26, 20261M context$0.15/M input$0.47/M outputText, Image, VideoText
VisionVideo inputToolsReasoning

Qwen3.8 27B is an open-weight dense vision-language model from Qwen. It is suited for coding, professional workflows, research, multimodal interaction, and long-running agent tasks, with flexible thinking that can be...

by qwenAug 14, 20261M context$0.214/M input$2.55/M outputText, Image, VideoText
Free

Qwen3 Reranker 8B is a text reranking model from Alibaba Cloud built on the Qwen3 architecture. It evaluates query-document pairs to produce relevance scores for use in retrieval and RAG...

by qwenAug 13, 202640.96K context$0/M input$0/M outputTextRerank
Audio input

Qwen3 ASR 1.7B is an automatic speech recognition model from Qwen. It supports multilingual language identification and transcription across 30 languages and 22 Chinese dialects, with streaming and offline inference...

by qwenAug 13, 2026N/A contextSpecialized media pricing · open model detailsAudioTranscription
Audio input

Qwen3 ASR 0.6B is a compact automatic speech recognition model from Qwen. It supports multilingual language identification and transcription across 30 languages and 22 Chinese dialects, with streaming and offline...

by qwenAug 13, 2026N/A contextSpecialized media pricing · open model detailsAudioTranscription
ToolsReasoning

Qwen3.8 2.4T A95B is an open-weight sparse mixture-of-experts model from Qwen and the open-weight variant of [Qwen3.8 Max](/qwen/qwen3.8-max), with 95 billion active parameters out of 2.4 trillion total. It is...

by qwenAug 12, 20261.05M context$2/M input$6/M outputTextText
ToolsReasoning

Qwen3.8 2.4T A95B is an open-weight sparse mixture-of-experts model from Qwen and the open-weight variant of [Qwen3.8 Max](/qwen/qwen3.8-max), with 95 billion active parameters out of 2.4 trillion total. It is...

by qwenAug 12, 20261.01M context$2/M input$6/M outputTextText
Image outputVision

Qwen Image 3 is a unified image generation and editing model from Qwen. It supports precise rendering of text and details as small as 10px, along with a richer world...

by qwenAug 5, 202665.54K contextSpecialized media pricing · open model detailsText, ImageImage
Image outputVision

Qwen Image 3 Pro is an image generation and editing model from Qwen. It supports precise rendering of text and details as small as 10px, along with richer world knowledge...

by qwenAug 5, 202665.54K contextSpecialized media pricing · open model detailsText, ImageImage
VisionVideo inputToolsReasoning

Qwen3.7 Flash is a vision-language reasoning model from Alibaba. It is suited for multimodal agents, visual coding, search, and computer interaction, with strengths in object recognition, spatial understanding, and real-world...

by qwenJul 27, 20261M context$0.03/M input$0.13/M outputText, Image, VideoText
VisionToolsReasoning

Qwen3.7-Plus is a cost-effective model in Alibaba's Qwen3.7 series. It supports text and image input with text output, building on the series' text capabilities with a comprehensive upgrade to its...

by qwenJun 3, 20261M context$0.32/M input$1.28/M outputText, ImageText
ToolsReasoning

Qwen3.7-Max is the flagship model in Alibaba's Qwen3.7 series. It supports text input and output and is designed for agent-centric workloads, with particular strengths in coding, office and productivity tasks,...

by qwenMay 21, 20261M context$1.48/M input$4.43/M outputTextText
Audio input

Qwen3-ASR-Flash is Alibaba's automatic speech recognition service, built on the Qwen3-Omni foundation and trained on tens of millions of hours of multimodal speech data. The model handles 11 languages —...

by qwenMay 14, 2026N/A contextSpecialized media pricing · open model detailsAudioTranscription
VisionVideo inputToolsReasoning

Qwen3.6 Flash is a fast, efficient language model from Alibaba's Qwen 3.6 series. It supports text, image, and video input with a 1M token context window. Tiered pricing kicks in...

by qwenApr 27, 20261M context$0.1875/M input$1.13/M outputText, Image, VideoText
VisionVideo inputToolsReasoning

Qwen3.6-35B-A3B is an open-weight multimodal model from Alibaba Cloud with 35 billion total parameters and 3 billion active parameters per token. It uses a hybrid sparse mixture-of-experts architecture combining Gated...

by qwenApr 27, 2026262.14K context$0.1/M input$0.9/M outputText, Image, VideoText
ToolsReasoning

Qwen3.6-Max-Preview is a proprietary frontier model from Alibaba Cloud built on a sparse mixture-of-experts architecture with approximately 1 trillion total parameters. It is optimized for agentic coding, tool use, and...

by qwenApr 27, 2026262.14K context$1.03/M input$6.16/M outputTextText
VisionVideo inputToolsReasoning

Qwen3.6 27B is a dense 27-billion-parameter language model from the Qwen Team at Alibaba, released in April 2026. It features hybrid multimodal capabilities — accepting text, image, and video inputs...

by qwenApr 27, 2026262.14K context$0.3/M input$2/M outputText, Image, VideoText
VisionVideo inputToolsReasoning

Qwen 3.6 Plus builds on a hybrid architecture that combines efficient linear attention with sparse mixture-of-experts routing, enabling strong scalability and high-performance inference. Compared to the 3.5 series, it delivers...

by qwenApr 2, 20261M context$0.325/M input$1.95/M outputText, Image, VideoText
VisionVideo inputToolsReasoning

Qwen3.5-9B is a multimodal foundation model from the Qwen3.5 family, designed to deliver strong reasoning, coding, and visual understanding in an efficient 9B-parameter architecture. It uses a unified vision-language design...

by qwenMar 10, 2026262.14K context$0.1/M input$0.15/M outputText, Image, VideoText
VisionVideo inputToolsReasoning

Qwen3.5-9B is a multimodal foundation model from the Qwen3.5 family, designed to deliver strong reasoning, coding, and visual understanding in an efficient 9B-parameter architecture. It uses a unified vision-language design...

by qwenMar 10, 2026262.14K context$0.17/M input$0.25/M outputText, Image, VideoText
Showing 24 of 64 matching models