CATALOG

Models

Find the right model by capability, context and price. Compare options or try one in Playground.

Output / endpointExact metadata
54 of 599 modelsReference token prices are per million tokens.
Image outputVisionReasoning

Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) is Google's fastest, most cost-efficient Gemini image model, built for high-velocity developer pipelines and rapid-fire visual exploration. It delivers text-to-image generation...

by googleJun 30, 202665.54K contextSpecialized media pricing · open model detailsImage, TextImage, Text
VisionAudio inputVideo input

Gemini Embedding 2 is Google's first multimodal embedding model. We currently support mapping text and images into a unified vector space for semantic search and retrieval-augmented generation (RAG). It supports...

by googleMay 20, 20268.19K context$0.2/M input$0/M outputText, Image, File, Audio, VideoEmbeddings
VisionAudio inputVideo input

Gemini Embedding 2 is Google's first multimodal embedding model. We currently support mapping text and images into a unified vector space for semantic search and retrieval-augmented generation (RAG). It supports...

by googleMay 20, 20268.19K context$0.1/M input$0/M outputText, Image, File, Audio, VideoEmbeddings
Audio input

Chirp 3 is Google's latest multilingual speech-to-text model. It offers enhanced transcription accuracy across 24 GA languages and 77+ preview languages, with support for automatic language detection, automatic punctuation, and...

by googleMay 5, 2026N/A contextSpecialized media pricing · open model detailsAudioTranscription
Vision

Google's mid-tier video generation model balancing speed and quality. Veo 3.1 Fast generates high-quality video from text or image prompts with native synchronized audio, offering faster turnaround than Veo 3.1...

by googleApr 24, 2026N/A contextSpecialized media pricing · open model detailsText, ImageVideo
Vision

Google's most cost-effective video generation model, designed for high-volume applications and rapid iteration. Veo 3.1 Lite generates 720p and 1080p video from text or image prompts with native synchronized audio...

by googleApr 23, 2026N/A contextSpecialized media pricing · open model detailsText, ImageVideo
VisionAudio inputVideo input

Gemini Embedding 2 Preview is Google's first multimodal embedding model. We currently support mapping text and images into a unified vector space for semantic search and retrieval-augmented generation (RAG). It...

by googleApr 17, 20268.19K context$0.2/M input$0/M outputText, Image, File, Audio, VideoEmbeddings
Showing 24 of 54 matching models