CATALOG

Models

Find the right model by capability, context and price. Compare options or try one in Chat.

Output / endpointExact metadata
24 of 647 modelsReference token prices are per million tokens.
Vision

Wan 3.0 Prime is a fast-mode variant of [Wan 3.0](https://clssai.com from Alibaba. It supports text-to-video and first-frame image-to-video generation.

by alibabaAug 27, 2026N/A contextSpecialized media pricing · open model detailsText, Image → Video
Vision

Wan 3.0 is a video generation model from Alibaba for text-to-video, image-to-video, and reference-guided video generation. It produces 480p, 720p, or 1080p video with durations from 2 to 30 seconds.

by alibabaAug 24, 2026N/A contextSpecialized media pricing · open model detailsText, Image → Video
Vision

HappyHorse 1.1 is a video generation model from Alibaba. It generates short videos from a text prompt, a single starting image, or a set of reference images, with output up...

by alibabaJun 24, 2026N/A contextSpecialized media pricing · open model detailsText, Image → Video
Vision

HappyHorse 1.0 is a video generation model from Alibaba. It generates short videos from a text prompt, a single starting image, or a set of reference images, with output up...

by alibabaJun 24, 2026N/A contextSpecialized media pricing · open model detailsText, Image → Video
Vision

Wan 2.7 is a video generation model from Alibaba. It supports text-to-video, image-to-video with first and last frame control, and reference-to-video, where multiple reference images guide the style and content...

by alibabaApr 15, 2026N/A contextSpecialized media pricing · open model detailsText, Image → Video
Vision

Alibaba's most advanced video generation model, supporting over 10 visual creation capabilities in a unified system. Wan 2.6 generates 1080p video at 24fps from text, images, reference videos, or audio,...

by alibabaMar 28, 2026N/A contextSpecialized media pricing · open model detailsText, Image → Video
VisionVideo inputToolsReasoning

Qwen3.8 Max 0902 is an updated snapshot of Qwen3.8 Max from Alibaba's Qwen team. It is a 2.4-trillion-parameter mixture-of-experts model that accepts text, image, and video input and returns text,...

by qwenSep 3, 20261M context$2/M input$6/M outputText, Image, Video → Text
VisionVideo inputToolsReasoning

Qwen3.8 Flash is a multimodal reasoning model from Alibaba. It is suited for coding assistance, agentic workflows, visual understanding, document and codebase analysis, desktop interaction, chart analysis, and long-video analysis.

by qwenAug 26, 20261M context$0.15/M input$0.47/M outputText, Image, Video → Text
Free

Qwen3 Reranker 8B is a text reranking model from Alibaba Cloud built on the Qwen3 architecture. It evaluates query-document pairs to produce relevance scores for use in retrieval and RAG...

by qwenAug 13, 202640.96K context$0/M input$0/M outputText → Rerank
VisionVideo inputToolsReasoning

Qwen3.7 Flash is a vision-language reasoning model from Alibaba. It is suited for multimodal agents, visual coding, search, and computer interaction, with strengths in object recognition, spatial understanding, and real-world...

by qwenJul 27, 20261M context$0.03/M input$0.13/M outputText, Image, Video → Text
VisionToolsReasoning

Qwen3.7-Plus is a cost-effective model in Alibaba's Qwen3.7 series. It supports text and image input with text output, building on the series' text capabilities with a comprehensive upgrade to its...

by qwenJun 3, 20261M context$0.32/M input$1.28/M outputText, Image → Text
ToolsReasoning

Qwen3.7-Max is the flagship model in Alibaba's Qwen3.7 series. It supports text input and output and is designed for agent-centric workloads, with particular strengths in coding, office and productivity tasks,...

by qwenMay 21, 20261M context$1.48/M input$4.43/M outputText → Text
Audio input

Qwen3-ASR-Flash is Alibaba's automatic speech recognition service, built on the Qwen3-Omni foundation and trained on tens of millions of hours of multimodal speech data. The model handles 11 languages —...

by qwenMay 14, 2026N/A contextSpecialized media pricing · open model detailsAudio → Transcription
VisionVideo inputToolsReasoning

Qwen3.6 Flash is a fast, efficient language model from Alibaba's Qwen 3.6 series. It supports text, image, and video input with a 1M token context window. Tiered pricing kicks in...

by qwenApr 27, 20261M context$0.1875/M input$1.13/M outputText, Image, Video → Text
VisionVideo inputToolsReasoning

Qwen3.6-35B-A3B is an open-weight multimodal model from Alibaba Cloud with 35 billion total parameters and 3 billion active parameters per token. It uses a hybrid sparse mixture-of-experts architecture combining Gated...

by qwenApr 27, 2026262.14K context$0.15/M input$1/M outputText, Image, Video → Text
ToolsReasoning

Qwen3.6-Max-Preview is a proprietary frontier model from Alibaba Cloud built on a sparse mixture-of-experts architecture with approximately 1 trillion total parameters. It is optimized for agentic coding, tool use, and...

by qwenApr 27, 2026262.14K context$1.03/M input$6.16/M outputText → Text
VisionVideo inputToolsReasoning

Qwen3.6 27B is a dense 27-billion-parameter language model from the Qwen Team at Alibaba, released in April 2026. It features hybrid multimodal capabilities — accepting text, image, and video inputs...

by qwenApr 27, 2026262.14K context$0.32/M input$3.2/M outputText, Image, Video → Text
Tools

Qwen3 Coder Plus is Alibaba's proprietary version of the Open Source Qwen3 Coder 480B A35B. It is a powerful coding agent model specializing in autonomous programming via tool calling and...

by qwenSep 23, 20251M context$0.65/M input$3.25/M outputText → Text
Tools

Qwen3 Coder Flash is Alibaba's fast and cost efficient version of their proprietary Qwen3 Coder Plus. It is a powerful coding agent model specializing in autonomous programming via tool calling...

by qwenSep 17, 20251M context$0.195/M input$0.975/M outputText → Text