Google AI Studio se ha consolidado como el playground técnico de referencia para desarrolladores que trabajan con la familia de modelos Gemini. A diferencia de un chatbot comercial, este entorno ofrece control granular sobre agentes autónomos, modelos multimodales, generación de imágenes y síntesis de voz. En esta guía analizamos para qué sirve cada modelo disponible y en qué escenario conviene utilizarlo.
Si buscas una referencia rápida, profesional y actualizada sobre el catálogo de modelos de AI Studio —desde Antigravity Agent hasta Nano Banana Pro—, esta es la clasificación definitiva por especialidad.
🧠 1. Agentes autónomos: automatización de tareas complejas
No son modelos conversacionales al uso. Son agentes que ejecutan acciones por sí mismos, ya sea operando sobre un sistema Linux remoto o investigando en profundidad a través de la web.
Modelo / Agente
Casos de uso ideales
antigravity-preview-09-2026Antigravity Agent
Ejecutar un agente autónomo sobre una máquina virtual Linux alojada en Google. Ideal para que la IA escriba archivos, instale librerías, programe y pruebe código en tiempo real. Es la versión más reciente y opera con Gemini 3.8.
antigravity-preview-05-2026
Versión anterior del mismo agente. Útil si tu infraestructura fue optimizada para el flujo de mayo de 2026.
deep-research-preview-04-2026
Investigación profunda con recopilación de múltiples fuentes y generación de reportes eficientes. Prioriza velocidad sobre exhaustividad.
deep-research-max-preview-04-2026
Versión SOTA del agente de investigación. Se elige cuando la prioridad es la exhaustividad máxima: informes hiperdetallados y cobertura total.
💻 2. Familia Flash: velocidad y flujos de trabajo
Los modelos Flash equilibran coste, latencia y capacidad analítica. Son la opción natural para producción a escala.
gemini-3.8-flash — El Flash insignia. Diseñado para ingeniería de software de largo alcance, agentes autónomos y flujos empresariales complejos que exigen razonamiento ágil.
gemini-3.7-flash — Optimizado para coding del día a día, uso de herramientas (tool use) y ejecución fiable de tareas multi-paso.
gemini-3.5-flash-lite — Ejecución masiva a alta velocidad. La elección cuando gestionas miles de peticiones automáticas con coste mínimo.
gemini-3.6-flash · gemini-3.5-flash · gemini-3-flash-preview — Generaciones previas. Se mantienen por compatibilidad con aplicaciones en producción.
🔬 3. Razonamiento avanzado: la familia Pro
gemini-3.1-pro-preview es el modelo con mayor profundidad de razonamiento lógico y comprensión multimodal. Se reserva para:
Tareas científicas y análisis matemáticos complejos.
Comprensión de archivos multimedia extensos con matices muy sutiles.
Depuración de código crítico de alto nivel.
🎨 4. Generación y edición de imágenes: la gama Nano Banana
Modelo
Perfil de uso
gemini-3.1-flash-lite-imageNano Banana 2 Lite
Generación y edición masiva a bajo coste: avatares para miles de usuarios, miniaturas automáticas, etc.
gemini-3.1-flash-imageNano Banana 2
Calidad visual profesional con velocidad Flash. Realismo elevado y buena relación calidad/precio.
gemini-3-pro-imageNano Banana Pro
Estado del arte en generación y edición. Para proyectos artísticos donde el detalle visual sea prioritario.
gemini-2.5-flash-imageNano Banana
Generación anterior, todavía útil para pipelines existentes.
🎙️ 5. Audio, voz y traducción
¿Qué modelo se usa para clonar voces?
La herramienta específica para esa tarea es gemini-3.8-flash-tts (Gemini 3.8 Flash TTS). Aunque técnicamente hablamos de Text-to-Speech, este modelo está diseñado para Voice Design, es decir, diseño y clonación de voz a partir de instrucciones.
Prompts de personalidad vocal: describe textualmente cómo quieres que suene la voz (p. ej., «mujer de unos 40 años, acento madrileño, tono profesional pero cálido, ritmo pausado»).
Control de guion: gestiona diálogos multi-hablante simulando el ritmo de una conversación real.
Dirección de entrega: emoción línea por línea (alegre, susurrante, enfadada) e inclusión de vocal bursts —risas, suspiros, carraspeos— para evitar un resultado robótico.
Alternativa para traducción con preservación de timbre: si lo que necesitas es hablar en tu idioma y que el modelo reproduzca tu voz en otro idioma en tiempo real, el modelo correcto es gemini-3.5-live-translate-preview (Gemini 3.5 Live Translate Preview).
Resto de la gama de audio
gemini-3.5-live-translate-preview — Traducción voz a voz en tiempo real para más de 70 idiomas con latencia mínima. Ideal para apps de llamadas o asistencia en vivo.
gemini-3.5-transcribe — Speech-to-text de alta precisión para archivos pregrabados pesados. Genera transcripciones estructuradas con metadatos de archivo.
gemini-3.1-flash-lite — Navaja suiza económica: texto, imagen, vídeo, audio y traducción masiva a bajo coste.
🎯 6. Aliases: enlaces inteligentes para producción
Los aliases son nombres fijos que apuntan automáticamente a la versión más reciente del modelo. Se usan en producción para evitar reescribir el código cada vez que Google publica una actualización.
Alias
Apunta a
gemini-pro-latest
Último modelo Pro disponible (actualmente gemini-3.1-pro-preview).
gemini-flash-latest
Último modelo Flash (actualmente gemini-3.8-flash).
gemini-flash-lite-latest
Último modelo ultraeconómico (actualmente gemini-3.5-flash-lite).
🤖 7. Robótica y razonamiento corporizado
gemini-robotics-er-2-preview es un modelo enfocado en Embodied Reasoning. Se emplea en investigación de robótica física para que máquinas y brazos mecánicos comprendan su entorno visual y planifiquen acciones lógicas en el mundo real.
Preguntas frecuentes
¿Qué diferencia hay entre Antigravity Agent y Deep Research?
Antigravity Agent opera sobre una máquina virtual Linux remota y ejecuta acciones sobre el sistema (crear archivos, instalar dependencias, ejecutar código). Deep Research está especializado en recopilar y sintetizar información de múltiples fuentes web para generar informes.
¿Qué modelo elijo para un chatbot de atención al cliente con alto volumen?
gemini-3.5-flash-lite. Es el más económico de la familia Flash y está optimizado para ejecución masiva a alta velocidad.
¿Cuál es la diferencia entre Gemini 3.8 Flash TTS y Live Translate?
El primero convierte texto en voz con diseño y clonación de timbre. El segundo traduce voz a voz en tiempo real, preservando el timbre del hablante original, en más de 70 idiomas.
¿Merece la pena usar aliases en producción?
Sí, especialmente si no quieres actualizar tu código cada vez que Google renueve el catálogo. La contrapartida es que un cambio de modelo subyacente puede alterar ligeramente el comportamiento de tu aplicación.
Ideas finales
Google AI Studio ya no es solo un banco de pruebas: es un ecosistema completo con agentes autónomos, modelos multimodales, generación de imágenes de alta fidelidad y síntesis de voz con clonación. Elegir bien el modelo en función de la tarea —velocidad, coste, profundidad de razonamiento o especialización— determina directamente la calidad y viabilidad económica de cualquier proyecto que integre IA generativa.
Si tu prioridad es la automatización end-to-end, apuesta por Antigravity Agent. Si es la investigación exhaustiva, Deep Research Max. Y si buscas producción masiva a bajo coste, la familia Flash-Lite es tu terreno natural.