
Gemini 3.6 Flash y 3.5 Flash-Lite: el modelo rápido de Google que cambia el balance (julio 2026)
Respuesta corta (60 segundos): Google lanzó el 21 de julio de 2026 tres modelos Flash: 3.6 Flash (USD 1.50/1M input, USD 7.50/1M output — 17% menos tokens que 3.5 con mejor calidad), 3.5 Flash-Lite (USD 0.30/1M input, USD 2.50/1M output — 350 tokens/s para alto volumen), y 3.5 Flash Cyber (solo para gobiernos/pilotos CodeMender). 3.6 Flash es el nuevo sweet spot para coding + agentic + multimodal con computer use built-in. 3.5 Flash-Lite gana en throughput/latencia para agentic search y document processing. 3.5 Pro está en testing con partners.
El 21 de julio de 2026 Google DeepMind liberó la actualización más significativa de la línea Flash desde Gemini 3: tres modelos nuevos pensados para producción de agentes AI a escala, donde el sweet spot entre costo, latencia y calidad es la decisión técnica que más impacta unit economics. Este post es la guía para elegir cuál de los tres (o si quedarte con 3.5 Flash) según tu workload.
Lo que cambió en 3.6 Flash
El patrón de Google con esta release es claro: más calidad con menos tokens y más barato. La métrica que más me importa del Artificial Analysis Index es la de output token usage: 3.6 Flash consume 17% menos tokens que 3.5 Flash para la misma tarea. En coding (DeepSWE) llega a 65% menos tokens en algunas configuraciones. Esto es dinero directo en tu factura de API, y latencia directa en tu producto.
Pricing de 3.6 Flash:
| Tipo | USD / 1M tokens |
|---|---|
| Input | 1.50 |
| Output | 7.50 |
Compará con 3.5 Flash antes de este release: 3.6 Flash sale más barato y entrega más calidad. Para equipos que ya están optimizando costos, el upgrade es obvious.
Benchmarks donde 3.6 Flash mejora:
| Benchmark | 3.5 Flash | 3.6 Flash | Mejora |
|---|---|---|---|
| DeepSWE (Datacurve) | 37% | 49% | +12 pts |
| MLE Bench | 49.7% | 63.9% | +14.2 pts |
| OSWorld-Verified (computer use) | 78.4% | 83.0% | +4.6 pts |
| GDPval-AA v2 | 1349 | 1421 | +72 |
Lo notable es la mejora en coding agentic (DeepSWE +12 puntos) — eso se traduce en menos edits no deseados, menos loops de ejecución, y menos tokens totales para resolver la misma tarea.
Computer use como built-in
Una decisión de producto que vale la pena destacar: 3.6 Flash incluye computer use como built-in tool del Gemini API. Esto significa que podés pasarle screenshots y pedirle acciones sobre interfaces gráficas sin armar un wrapper custom.
Para casos como "testear este flujo de UI" o "completar este form con datos del usuario", ya no necesitás una integración separada con un modelo de visión + un action parser. El mismo modelo decide qué hacer.
3.5 Flash-Lite: el rey del throughput
Si tu workload es alto volumen + latencia crítica, 3.5 Flash-Lite es el modelo de la release. Las specs:
| Spec | Valor |
|---|---|
| Output throughput | 350 tokens/s |
| Input price | USD 0.30 / 1M tokens |
| Output price | USD 2.50 / 1M tokens |
| Reasoning levels | minimal / low / high (configurable) |
Dónde gana Flash-Lite:
- Agentic search a escala — búsquedas masivas donde la latencia de respuesta impacta UX
- Document processing batch — clasificación, extracción de datos, validación
- Customer support tier 1 — clasificación + primera respuesta donde el SLA de latencia es crítico
- High-volume classification — moderación, routing, tagging
Sorpresa interesante del benchmark: 3.5 Flash-Lite supera a 3 Flash en coding y agentic:
| Benchmark | 3 Flash | 3.5 Flash-Lite |
|---|---|---|
| SWE-Bench Pro | 49.6% | 54.2% |
| OSWorld-Verified | 65.1% | 74.0% |
| Terminal-Bench 2.1 | 31% | 54% |
| GDPval-AA v2 | 642 | 1140 |
Si tenés workloads en Flash clásico, vale la pena probar Flash-Lite — sale más barato y rinde mejor en varios casos.
3.5 Flash Cyber: piloto cerrado
Google también liberó Gemini 3.5 Flash Cyber, fine-tuned para encontrar y arreglar vulnerabilidades de código, usado como base del agente CodeMender. La twist: no es accesible públicamente. Solo gobiernos y partners trusted vía CodeMender como parte de un programa piloto de acceso limitado.
Razón declarada: la dual-use nature del modelo (lo que sirve para defenders también sirve para attackers) requiere distribución controlada. Si trabajás en seguridad y querés acceso, el camino es contactar al equipo de CodeMender directamente.
3.5 Pro: todavía en testing
Google confirma que 3.5 Pro está en testing con partners y planean hacerlo disponible broadly cuando esté listo. Mientras tanto, si tu workload necesita el tier más capaz de Gemini, hoy la opción es Gemini 3 Pro (la versión previa) o mirar fuera del ecosistema Google.
Cuándo elegir cada uno
Elegí 3.6 Flash si:
- Tu workload es coding agentic con tool calling sostenido
- Necesitás multimodal (computer use, screenshots, charts) en producción
- Querés el mejor balance costo/calidad para knowledge work
- Tu producto es un agente AI donde cada token cuenta
Elegí 3.5 Flash-Lite si:
- Volumen alto donde el costo por call es el driver principal
- Latencia crítica (UX donde el usuario espera menos de 2 segundos para respuestas simples)
- Tareas simples a escala (classification, extraction, routing)
- Workloads donde el SLA de uptime es prioritario
Quedate con 3.5 Flash si:
- Ya tenés integración profunda en 3.5 Flash y el upgrade no está justificado por ahorro
- Workloads donde la estabilidad probada importa más que el cutting edge
Elegí Claude Haiku si:
- Tu ecosistema ya está en Anthropic y el costo de switching es alto
- Necesitás compliance maduro (HIPAA, SOC2) que Anthropic ya certificó
Elegí GPT-5.6 mini si:
- Tu ecosistema ya está en OpenAI
- Necesitás function calling con features específicas de OpenAI
Disponibilidad y pricing detallado
3.6 Flash está disponible desde el 21 de julio en:
- Gemini API via Google AI Studio y Android Studio
- Google Antigravity
- Gemini Enterprise Agent Platform
- Gemini Enterprise app
3.5 Flash-Lite está disponible en los mismos canales + Google Search (rolling out).
Pricing final por modelo:
| Modelo | Input USD/1M | Output USD/1M | Throughput |
|---|---|---|---|
| Gemini 3.6 Flash | 1.50 | 7.50 | medio |
| Gemini 3.5 Flash-Lite | 0.30 | 2.50 | 350 tok/s |
| Gemini 3.5 Flash (anterior) | más caro | más caro | medio |
El ángulo LATAM: tres cosas concretas
-
Pricing en USD sin variación regional. Google no cobra distinto por región para Gemini API, así que el costo es el mismo en Buenos Aires que en San Francisco. Esto nivelá el playing field contra proveedores que sí tienen regional pricing diferenciado.
-
Computer use para productos B2B. Si tu SaaS necesita automatizar flujos de UI (formularios web, dashboards, ERPs), 3.6 Flash con computer use built-in baja la barrera de entrada significativamente.
-
Throughput de Flash-Lite para support bots. Si tenés un chatbot de soporte con miles de conversaciones simultáneas, Flash-Lite a 350 tokens/s cambia las matemáticas de cuántos agentes podés tener activos.
¿Querés discutir cuál de los tres Flash tiene sentido para tu caso antes de cambiar de modelo o migrar código? Hay un CTA al final con una llamada gratis de 30 minutos.
Preguntas frecuentes
¿Qué es Gemini 3.6 Flash en una frase?
Es el modelo "workhorse" de Google para producción de agentes AI: 17% menos output tokens que 3.5 Flash en el Artificial Analysis Index, mejor calidad en coding (DeepSWE 49% vs 37%) y multimodal más eficiente. Precio: USD 1.50/1M input, USD 7.50/1M output. Es el sweet spot entre costo, latencia y calidad para agentic workflows.
¿En qué se diferencia de Gemini 3.5 Flash?
3.6 Flash entrega más calidad con menos tokens: en el Artificial Analysis Index consume 17% menos output tokens, en DeepSWE pasa de 37% a 49%, en MLE Bench de 49.7% a 63.9%, en OSWorld-Verified de 78.4% a 83.0%. Computer use ahora es una tool built-in del Gemini API. Y sale más barato: USD 1.50/1M input vs USD más caro de 3.5 Flash en el tier equivalente.
¿Qué es Gemini 3.5 Flash-Lite y cuándo usarlo?
Es el modelo más rápido y económico de la serie 3.5: 350 output tokens/s, USD 0.30/1M input y USD 2.50/1M output. Pensado para high-volume agentic search, document processing, y tareas donde la latencia mínima es el requirement. Supera a 3 Flash en coding (SWE-Bench Pro 54.2% vs 49.6%) y agentic (OSWorld 74.0% vs 65.1%).
¿Cuándo conviene 3.6 Flash vs 3.5 Flash-Lite vs 3.5 Pro?
3.6 Flash para el sweet spot general (coding, knowledge work, multimodal con tool use sostenido). 3.5 Flash-Lite para volumen alto con latencia crítica (search agents, document processing batch, classification a escala). 3.5 Pro todavía está en testing con partners — esperá unas semanas si podés.
¿Cómo se compara con Claude Haiku o GPT-5.6 mini?
3.6 Flash compite en el mismo segmento que Claude Haiku y GPT mini pero con pricing más agresivo en output (USD 7.50/1M vs más caro de Haiku) y computer use como built-in. 3.5 Flash-Lite es especialmente fuerte en throughput — 350 tokens/s es difícil de igualar con Haiku. Para coding agentic, la decisión suele ser Gemini 3.6 vs Claude Sonnet, no vs Haiku.
¿Tiene mejoras de seguridad?
Sí. 3.6 Flash sale con safeguards de Frontier Safety reforzadas en dominios CBRN (Chemical, Biological, Radiological, Nuclear) y cyber offense misuses. El modelo es más resistente a jailbreaks pero está entrenado para minimizar refusals en usos beneficiosos. Verificá el model card para casos límite.