OpenAI lanzó GPT-Live: voice full-duplex ya está en el plan Free. Qué cambia para tu SaaS en Latam

OpenAI lanzó GPT-Live: voice full-duplex ya está en el plan Free. Qué cambia para tu SaaS en Latam

30 de julio del 202616 minAI, OpenAI, GPT-Live, voice, SaaS, Latam, unit-economics

Respuesta corta (60 segundos): El 8 de julio de 2026 OpenAI lanzó GPT-Live, su familia de modelos de voz full-duplex (escuchan y hablan al mismo tiempo), con dos versiones: GPT-Live-1 como default para Go/Plus/Pro y GPT-Live-1 mini como default para el tier Free (Introducing GPT-Live). Es la primera vez que OpenAI lleva full-duplex al plan Free (Advanced Voice Mode, la generación anterior, era turn-based y nunca estuvo en Free) — y, según Reuters, también la primera vez que un ChatGPT Voice capaz de “escucharte mientras te habla” llega a una base instalada masiva. Para un founder SaaS en Latam eso significa que el costo de prototipar un agente de voz en español/portugués baja a USD 0 en la fase de demo y obliga a recalcular la unit economics de producción.

El 30 de julio, 22 días después del lanzamiento, todavía veo founders Latam que no recalcularon nada. La pregunta que me llegó tres veces esta semana fue "¿dejo de pagar Retell/Vapi y uso GPT-Live directo?". La respuesta corta: depende del caso. Este post te da el framework con números reales, la tabla comparativa con wrappers, y la checklist operativa para decidir esta semana.

Disclosure: no tuve acceso a GPT-Live-1 vía API al escribir esto — el acceso para developers sigue siendo un formulario de notificación y no un endpoint abierto (confirmado por Digital Applied). Los precios de la API que cito son los de la familia gpt-realtime-2.x (generación full-duplex anterior, en producción desde mayo) tomados del pricing page de OpenAI capturado el 13 de julio y de Aireiter. Donde tiro un número sin fuente exacta, lo aclaro en el texto.

Qué pasó esta semana (y por qué importa)

OpenAI lanzó GPT-Live el 8 de julio de 2026, abriendo dos modelos nuevos de voz a la base global de ChatGPT (Introducing GPT-Live, Reuters, 8 jul 2026, Business Insider: The Whirlwind 72 Hours of Rival AI Announcements). Lo позициониaron como el reemplazo de Advanced Voice Mode, con la promesa de que "se siente como hablar con una persona" — porque literalmente puede escucharte mientras te habla.

Cuatro datos del lanzamiento que importan para el founder Latam:

1. Dos modelos en simultáneo, con el Free ya adentro. GPT-Live-1 queda como default para los planes pagos (Go, Plus, Pro). GPT-Live-1 mini queda como default para el plan Free. Es la primera vez que OpenAI lleva full-duplex a un SKU en $0 (Advanced Voice Mode, la generación anterior, era turn-based y nunca estuvo en Free) — no una demo recortada, sino el mismo modelo corriendo en infraestructura compartida.

2. Full-duplex de verdad, no turn-based disfrazado. GPT-Live toma decisiones de "hablar / seguir escuchando / pausar / interrumpir / llamar a una tool" muchas veces por segundo. Advanced Voice Mode (la generación anterior) esperaba al final de tu turno. La diferencia práctica: te deja interrumpirlo en cualquier momento, sin la pausa robótica del "había terminado de hablar" (MarkTechPost via Kie.ai).

3. Hands-off a GPT-5.5 para razonamiento. Cuando la pregunta necesita búsqueda web, lógica larga o un tool call, GPT-Live delega a GPT-5.5 corriendo en background y vuelve a la conversación cuando el subagente termina. El voice loop no se rompe. Es la arquitectura que el resto de los vendors te cobra armar como pipeline STT → LLM → TTS.

4. No hay API todavía, pero la cola ya está abierta. El post oficial dice "coming soon to the API, sign up to be notified". Nadie afuera de OpenAI puede construir un agente customer-facing sobre GPT-Live hoy. Para producción real seguís en gpt-realtime-2.x, que ya está en API desde mayo y mantiene la misma arquitectura full-duplex.

El contexto macro: la semana del lanzamiento fue, según Business Insider, "72 horas de anuncios de AI non-stop" — OpenAI con GPT-Live y GPT-5.6, Meta con Muse Spark 1.1, SpaceXAI con Grok 4.5, Anthropic con Reflect. Si sos founder SaaS en Latam, el costo de construir voice-first en español/portugués cae estructuralmente — la pregunta ya no es si se puede, es qué stack te conviene.

GPT-Live vs Vapi vs Retell vs LiveKit — la tabla honesta

Antes de decidir "construir vs comprar vs OpenAI directo", mirá qué hace cada uno. La tabla compara las opciones que un founder SaaS Latam evalúa en julio de 2026:

CapacidadGPT-Live (Free / Plus)VapiRetell AILiveKit Agents
Tipo de modeloFull-duplex speech-to-speech (OpenAI)STT → LLM → TTS, modularSTT → LLM → TTS, bundledSTT → LLM → TTS o speech-to-speech
Acceso vía APINo en launch (signup only)Sí, REST + WebSocketSí, REST + WebSocketSí, self-host o Cloud
All-in cost (USD/min)$0 si Free; $0.06–$0.11 con Realtime API$0.13–$0.32$0.07–$0.31$0.05–$0.22
Telephony (Twilio, etc.)No incluidoBYO Twilio/TelnyxIncluidoBYO SIP / Twilio
STT / TTS proveedoresNativos (parte del modelo)Deepgram + ElevenLabs defaultDeepgram / AssemblyAIDeepgram / ElevenLabs / Whisper
LLM razonadorGPT-5.5 en backgroundBYO (cualquier OpenAI/Anthropic)BYO (default GPT-4.1 Nano)BYO (cualquier modelo)
Latencia end-to-end~300 ms (voces nativas)500–800 ms500–900 ms400–900 ms
Barge-in (interrupción)Sí, nativoConfigurableConfigurableConfigurable
Compliance / enterpriseNo Business/Enterprise/Edu al launchHIPAA add-on $1K/mesSOC2SOC2
Español rioplatenseBien en demosBien con voz ElevenLabs TurboBien con voces LatamBien con TTS correcto
Tiempo a primera llamadaMinutos (consumer)1 día3 horas2–4 semanas

Lectura rápida de la tabla:

  • GPT-Live Free es la demo más barata de la historia del voice-first SaaS. Para un hackathon o prototipo, no gastás un centavo. El problema aparece cuando querés una llamada real con tu número de Twilio, transcripción persistente y analytics — ahí todavía necesitás un wrapper.
  • Vapi cobra "poco" en plataforma ($0.05/min) pero la factura real termina en $0.13–$0.32/min una vez que sumás Twilio + Deepgram STT + LLM + ElevenLabs TTS (Retell, caller.digital). Es el clásico "headline price vs real cost".
  • Retell te lo da bundled a $0.07–$0.31/min según tier de voz y LLM. Es la opción más rápida para producción si no querés administrar 4 proveedores (Dev.to, Abr 2026).
  • LiveKit es la opción "build" con el costo más bajo ($0.05–$0.22/min all-in) pero requiere 2–4 semanas de ingeniería (Fora Soft, 2026).
  • La latencia importa más que el precio para Latam. Vapi/Retell promedian 500–900 ms. GPT-Live nativo baja a ~300 ms. En un agente de ventas, esa diferencia es la línea entre "se siente como una persona" y "un bot".

Disclaimer de tabla: los precios de Vapi/Retell/LiveKit son ranges publicados en julio 2026, sujetos a cambios por plan / región / volumen. Confirmá en el dashboard de tu provider antes de cotizar a un cliente.

Qué significa "GPT-Live full-duplex gratis" en tu unit economics

El titular dice "cero costo" — pero la realidad tiene tres capas: Free con límites, plan pago incluido, y producción real con la familia gpt-realtime-2.x en la API. Acá va el cálculo con el caso más común: un agente de customer service SaaS en español para Latam.

Caso base: SaaS con 10,000 llamadas/mes de customer service en español, 2.5 min por llamada, mix 60% usuario / 40% agente. Son 25,000 minutos/mes de audio total (15,000 minutos de usuario + 10,000 minutos de agente).

Capa 1 — Demo y prototipado con GPT-Live Free

El plan Free te deja usar GPT-Live-1 mini sin pagar nada. El catch: los límites de minutos son los del Free de ChatGPT y OpenAI los cambia sin avisar mucho (Eesel). Para un founder que necesita 50–200 minutos/mes para demo, tests A/B y validación con clientes, Free es suficiente y el costo marginal es cero. No gastás en Twilio porque las llamadas van por la app de ChatGPT (no podés usar tu número, pero para demo no importa).

Costo por capa: $0. Lo único que pagás es el tiempo de tu dev prototipando.

Capa 2 — Producción en plan Plus/Pro

El plan Plus ($20/mes) lleva minutos incluidos pero sigue atado a la app de ChatGPT — no podés meterle tu Twilio, tu CRM ni tu analytics. Para Latam SaaS B2B, esta capa no sirve salvo que el caso sea "usuario habla con un ChatGPT experto en mi producto" (patrón real para onboarding).

Costo por capa: $20/mes por agente humano que se loguea, sin escalabilidad a 100+ llamadas concurrentes.

Capa 3 — Producción real con la API gpt-realtime-2.x

La API lleva la misma arquitectura full-duplex a producción. Pricing del pricing page de OpenAI capturado el 13 de julio:

ModeloAudio in (1M tok)Cached audio in (1M tok)Audio out (1M tok)Costo por minuto (típico)
gpt-realtime-2.1 (flagship)$32.00$0.40$64.00$0.04–$0.06
gpt-realtime-2.1-mini$10.00$0.30$20.00$0.01–$0.02
gpt-realtime-translate$0.034/min flat$0.034/min
gpt-realtime-whisper (STT only)$0.017/min flat$0.017/min

Cálculo para 10,000 minutos/mes en español (60% usuario / 40% agente):

Conversión de audio a tokens (Fora Soft): 1 minuto de usuario = 600 tokens, 1 minuto de agente = 1,200 tokens. Para 25,000 minutos totales (10K llamadas × 2.5 min): 9M tokens input, 12M tokens output, 8M tokens cacheados (system prompt de 2K repetido en 4K calls).

gpt-realtime-2.1-mini con prompt caching (escenario más realista para Latam):

  • Input fresh: 9M × $10/1M = $90
  • Input cacheado: 8M × $0.30/1M = $2.40
  • Output: 12M × $20/1M = $240
  • Total: $332/mes$0.0133/min all-in ($332 / 25,000 min)

gpt-realtime-2.1 flagship con prompt caching:

  • Input fresh: 9M × $32/1M = $288
  • Input cacheado: 8M × $0.40/1M = $3.20
  • Output: 12M × $64/1M = $768
  • Total: $1,059/mes$0.0424/min all-in ($1,059 / 25,000 min)

Comparado con Vapi all-in ($0.13–$0.32/min): gpt-realtime-2.1-mini con cache te queda 90% más barato que Vapi en el extremo bajo ($0.0133 vs $0.13) y 96% más barato en el extremo alto ($0.0133 vs $0.32). gpt-realtime-2.1 flagship sale 67% más barato que el tier bajo de Vapi ($0.0424 vs $0.13) y 87% más barato que el alto ($0.0424 vs $0.32), con la ventaja de la latencia nativa de 300 ms vs los 500–800 ms de Vapi.

A 100,000 minutos/mes (~700 llamadas/día, volumen de un SaaS mediano en Latam) — escalado lineal 4x:

  • gpt-realtime-2.1-mini con cache: $1,328/mes
  • gpt-realtime-2.1 flagship con cache: $4,236/mes
  • Vapi all-in equivalente: $13,000–$32,000/mes

La diferencia de $12K–$31K/mes entre GPT-Realtime-mini y Vapi a escala paga un EOM extra. O, del otro lado, vuelve viable un plan de $29/mes que antes tenía COGS de inference del 40%.

Disclaimer de cálculo: los tokens asumen un system prompt de 2,000 tokens repetidos. Si tu prompt es más corto, el cache hit naturalmente baja y el costo sube 10–20%. Corré tu propio cálculo con tu mix real antes de comprometerte.

Qué auditar en tu SaaS esta semana

Checklist operativa para correr lunes a viernes. La idea: que tengas evidencia para la próxima planning con el CFO, no intuición.

1. Identificá tus minutos de voz actuales (o tu intención de tenerlos). Si ya tenés un agente corriendo, necesitás un dashboard con minutos consumidos por (modelo, día, canal, idioma) en los últimos 30 días. Si todavía no tenés voz, definí el caso de uso y estimá ticket × duración.

2. Calculá el costo por uso lógico, no por minuto. "Llamada de soporte resuelta por IA" cuesta X. "Llamada transferida a humano" cuesta X + Twilio transfer fee. "Onboarding guiado por voz" cuesta W. Eso te da el COGS unitario. Si un usuario Pro paga $29/mes y le generás $11 de voz (40 min × $0.28 all-in en Vapi), tenés 38% COGS. Si migrás a gpt-realtime-2.1-mini con cache, el COGS baja a ~$0.53 (1.8%, 40 min × $0.0133) — el mismo usuario es rentable de nuevo.

3. Medí tu latencia cross-border hoy. GPT-Live y gpt-realtime-2.x corren en infraestructura US. Desde São Paulo, Buenos Aires o Bogotá esperá un RTT base de 120–180 ms al endpoint + 150–250 ms de procesamiento. Total: 300–430 ms, dentro del rango bueno. El killer es cuando agregás STT (Deepgram) US + LLM (OpenAI) US + TTS (ElevenLabs) EU — el pipeline suma 500–800 ms. Con full-duplex nativo, ese problema desaparece.

4. Corré un piloto de 100 llamadas con Free antes de pagar nada. Activá GPT-Live Free, definí un script de prueba, llamá a 5 amigos con el celular de un dev y pediles que intenten interrumpir, hacer preguntas ambiguas y hablar con acento (porteño, andino, costeño). Documentá: trabas en pausas, palabras no entendidas, tiempo de respuesta, sensación de "persona" vs "bot". Con 100 llamadas tenés evidencia para decidir. Inversión: 2–3 tardes.

5. Negociá commit con tu proveedor si pasás de 50K minutos/mes. Los descuentos en voz son del 20–35% sobre el precio público. Encima del caching y del mini tier, podés terminar pagando ~$0.009/min en vez de $0.0133/min — un 30% menos que el rate con cache a precio de lista.

Cuándo NO conviene GPT-Live

GPT-Live es competitivo pero no es reemplazo universal. Tres casos donde te conviene Vapi, Retell, LiveKit o un IVR clásico:

1. Compliance y datos sensibles. GPT-Live consumer (Free, Plus, Pro) no está disponible en workspaces Business, Enterprise ni Edu (OpenAI Help Center via Digital Applied). Si tu SaaS vende a hospitales, financieras o gobierno, el Free queda afuera por default. Vapi tiene HIPAA add-on ($1K/mes, según Retell) y Retell/LiveKit tienen SOC2 nativo. GPT-Live en la API va a tener un camino enterprise, pero todavía no está anunciado con timeline.

2. Necesitás una tool stack abierta y auditable. GPT-Live es un modelo cerrado: le pasás audio, te devuelve audio, no podés inspeccionar la transcripción intermedia ni el tool call que eligió. Si tu caso requiere explicabilidad (auditoría regulatoria, debugging de errores en producción, compliance de la conversación), un pipeline STT → LLM → TTS abierto (Vapi, Retell, LiveKit) te da acceso a cada paso. Esto es importante en cobranzas, salud y legal.

3. Volumen bajo con necesidad de números regionales. Si hacés 2,000 minutos/mes y necesitás números en México, Argentina, Brasil y Colombia, el costo de portar números en Twilio + GPT-Realtime API es mayor que pagar Vapi all-in con números incluidos. Vapi y Retell te resuelven el multi-regional; GPT-Live API todavía no tiene presencia regional anunciada.

Cuándo NO conviene migrar a un wrapper caro "por las dudas": si tu caso es customer service con guion corto + FAQ, y estás sobre 50K+ minutos/mes, el ahorro de migrar de Vapi a gpt-realtime-2.x con cache (90–96% según tier, mini contra Vapi low/high) es material. No pagues de más el bundling si podés operar la stack vos mismo.

Tres prácticas operativas que aplican estés donde estés

Independientemente del stack que elijas, hay tres optimizaciones que bajan la factura 40–70% combinadas:

1. Activá Voice Activity Detection (VAD) y prompt caching antes de cambiar de provider. El VAD evita que el modelo gaste tokens en silencios del usuario. El prompt caching baja el costo del system prompt repetido a $0.30/MTok en el mini tier — 30x más barato que el input fresco. Sin tocar el modelo, estos dos cambios bajan la factura típica 50–60% (Aireiter).

2. Medí WER en tu propio set de acentos antes de prometer SLA al cliente. El español rioplatense neutro anda bien en los demos de OpenAI. El español andino, el caribeño y el portugués de Brasil con su mezcla de fonemas son otra historia. Grabá 30 audios de tus clientes reales con acento variado, pasalos por la transcripción de GPT-Live o Deepgram, y medí WER (Word Error Rate). Si tu WER supera el 12% en un segmento, no prometas SLA en esa vertical — derivá a humano cuando la confianza cae bajo umbral.

3. Diseñá fallback a humano desde el día uno. Voice-first no es "reemplazar humanos", es "manejar 80% de las llamadas de bajo contexto y derivar el 20% crítico a un humano con el contexto ya cargado". Un agente de voz sin fallback degrada la experiencia del cliente cuando se equivoca. Diseñá el handoff desde el día uno: timeout → humano, error de transcripción → humano, intent de cancelación → humano. La línea entre "voice-first funciona" y "voice-first destruye tu marca" pasa por ese fallback.

Conclusión

El titular — "voice full-duplex en Free" — es real, pero la lectura ingenua ("reemplazo mi call center con ChatGPT") es peligrosa. Lo que GPT-Live cambia de verdad: el costo de prototipar un agente de voz baja a cero, y la unit economics de producción mejora 90–96% respecto a un wrapper all-in si operás vos mismo la API de Realtime. Lo que NO cambia: necesitás un wrapper (Vapi, Retell, LiveKit) para compliance, números regionales y tool stack auditable, y necesitás fallback a humano.

Tres recomendaciones operativas para el cierre de julio:

  1. Corré un piloto de 100 llamadas con GPT-Live Free esta semana. No con producción, no con clientes reales, no con tu número de Twilio. Con 5 amigos, una lista de preguntas incómodas y un cronómetro. Si pasa "se siente como una persona", pasás a la siguiente etapa. Si no, el problema no era el precio.
  2. Calculá tu COGS unitario por canal (voz / texto / email / chat) antes de decidir stack. Si tu COGS de voz supera el 30% del revenue del usuario, tenés un problema de pricing o de duration. Ningún modelo te lo arregla si el agente se queda 4 minutos por llamada.
  3. Si vendés a enterprise con compliance, esperá la API enterprise de GPT-Live. Es quarters, no semanas. Mientras tanto, Vapi HIPAA o Retell SOC2 te cubren. No pongas un deal de $50K/año en riesgo por ahorrar $3K/mes en provider.

Si tu startup está evaluando construir un agente de voz en español/portugués o migrar de Vapi/Retell a la API de OpenAI, reservá una llamada gratis de 30 minutos — en 20 minutos solemos poder calcularte el ahorro mensual con tu mix de minutos y tu caso de uso real.


Leer también:

Preguntas frecuentes

¿Qué es GPT-Live y qué cambia frente a ChatGPT Voice?

GPT-Live es la nueva familia de modelos de voz full-duplex de OpenAI. A diferencia de ChatGPT Voice (turn-based), escucha y habla al mismo tiempo: te deja interrumpir, no espera al final del turno, y mantiene prosodia y pausas naturales. Se libera a Free, Go, Plus y Pro.

¿Cuánto cuesta realmente usar GPT-Live en producción desde Latam?

En el plan Free el costo monetario es cero pero hay límites de minutos. Plus/Pro llevan minutos incluidos. En la API, el precio todavía no está publicado en todas las regiones y hay que sumarle latencia cross-border (servidores US), que en voz es un killer. Para un agente de ventas en español, un round-trip de 800ms es la línea entre usable y frustrante.

¿Puede GPT-Live reemplazar a mi IVR o a Retell/Vapi hoy?

Depende del caso. Para un agente de customer service con guion corto y FAQ, sí — prototipás en una tarde. Para un agente que negocia, maneja objeciones o pasa datos sensibles, todavía necesitás un wrapper (Vapi, Retell, LiveKit) que te dé control de barge-in, timeouts, transcripción y compliance. GPT-Live es el modelo, no el stack.

¿Qué hago con la calidad de español/portugués y los acentos Latam?

OpenAI entrenó con datos multilingües y el español rioplatense/neutro funciona bien en los demos. Los acentos andinos y caribeños siguen siendo el talón de Aquiles — medí WER (word error rate) en tu propio set antes de prometer SLA al cliente. Tené un fallback a humano cuando la confianza cae bajo umbral.