Skip to main content
Google AI’s Gemini models. Multimodal-first design — image, audio, video input alongside text.
Full walkthrough being written.

When to pick

  • You need vision capabilities (image analysis, OCR).
  • Audio input is a primary feature.
  • You want very long context (1M+ tokens).

Setup

GOOGLE_AI_API_KEY in vly secrets. Use @google/generative-ai SDK from a Convex action.

Models

OpenAI

Comparison.

Anthropic

Comparison.

Gemini CLI agent

The vly agent powered by Gemini.
Last modified on April 18, 2026