desarrollo · 4 min de lectura
GPT-Live-1 de OpenAI: voz full-duplex y qué implica para tu empresa
OpenAI lanza GPT-Live-1, un modelo de voz full-duplex que escucha y habla a la vez. Qué es y qué mirar antes de llevarlo a la atención telefónica de tu empresa.
OpenAI presentó el 8 de julio de 2026 GPT-Live-1, un modelo de voz con arquitectura full-duplex: escucha y habla a la vez, como haría una persona, en lugar de esperar turnos como los asistentes de voz clásicos. Un día después llegó GPT-5.6 (familia Sol, Terra y Luna), el modelo de razonamiento al que GPT-Live-1 delega las tareas complejas. Para cualquier empresa que atiende llamadas —reservas, citas, soporte— la pregunta ya no es si la IA de voz suena bien en una demo, sino si aguanta una centralita real.
Qué cambia con la voz full-duplex
Los asistentes de voz que conocemos —Siri, Alexa, la mayoría de bots telefónicos— funcionan en semidúplex: uno habla, el otro espera, y si te interrumpes se rompe la conversación. GPT-Live-1 usa una arquitectura full-duplex que decide varias veces por segundo si debe hablar, escuchar, callar o interrumpir, e incorpora señales conversacionales naturales (“mhmm”, “vale”) para sonar menos robótico. Según el anuncio oficial de OpenAI, el modelo se apoya en GPT-5.6 cuando la conversación requiere razonamiento profundo, búsqueda o varios pasos, sin romper el flujo de la llamada. TechCrunch confirma el despliegue en iOS, Android y ChatGPT.com, con una variante mini disponible también en el plan gratuito.
No es un anuncio aislado: OpenAI lanzó el mismo mes la familia GPT-5.6 Sol, Terra y Luna, con un modo de razonamiento ampliado y la capacidad de coordinar subagentes para tareas complejas, según la nota de OpenAI sobre GPT-5.6. La combinación —voz natural en tiempo real más un modelo de razonamiento más potente por detrás— es la que de verdad importa para uso empresarial: no solo suena mejor, también puede hacer más cosas dentro de la misma llamada.
Por qué le importa a tu negocio, no solo a los desarrolladores
Si tu empresa recibe llamadas fuera de horario, pierde reservas por no contestar a tiempo o dedica horas de recepción a preguntas repetitivas, esto te afecta directamente. Un hotel o restaurante que no puede atender el teléfono a las once de la noche pierde esa reserva. Una clínica que satura la centralita con confirmaciones de cita gasta en ello el tiempo de una persona. Un despacho de servicios profesionales filtra llamadas antes de pasar cada una a quien corresponde. En todos los casos, la mejora no es “que la IA hable más natural”: es que puede entender la petición, comprobar disponibilidad y actuar —agendar, confirmar, transferir— sin que el interlocutor note que discutía con un modelo minutos antes.
De la demo a la centralita: lo que el titular no cuenta
Aquí está la parte que se suele pasar por alto. GPT-Live-1 es extraordinario en ChatGPT, hablando con una persona a través del móvil o el navegador. Pero una línea de atención telefónica real necesita bastante más que un modelo de voz potente:
- Conexión con la red telefónica. El modelo no marca ni descuelga llamadas por sí solo; hace falta integrarlo con telefonía (por ejemplo Twilio) y un servidor de voz que gestione la conversación en tiempo real.
- Conocimiento de tu negocio. Sin una base de conocimiento propia (RAG) conectada a tus datos reales —precios, disponibilidad, políticas—, el modelo responde con generalidades o inventa.
- Transferencia a una persona. Cualquier agente de voz serio necesita saber cuándo escalar la llamada a un humano, no solo cuándo seguir hablando.
- Trazabilidad. Transcripción, grabación y puntuación de cada llamada para poder medir conversión y calidad, no solo “que suene bien”.
- Dónde viven los datos. Para muchos sectores regulados (sanidad, servicios financieros) importa que la infraestructura de voz corra en Europa.
Es exactamente el terreno donde trabajamos con Elop, nuestra propia plataforma de agentes de voz con IA: usa voz en tiempo real de OpenAI combinada con ElevenLabs y Cartesia para una latencia de síntesis de unos 40 ms, un servidor de voz propio en Node.js sobre Twilio y una base de conocimiento RAG con los datos reales de cada negocio, todo sobre infraestructura europea. Un modelo de voz mejor —como GPT-Live-1— sube el techo de lo que es posible, pero la fiabilidad de una centralita 24/7 sigue dependiendo de esas piezas de ingeniería alrededor del modelo.
Qué mirar antes de adoptarlo
Antes de sustituir tu centralita o tu chatbot de reservas por un agente de voz, conviene comprobar cuatro cosas: si responde con tus datos y no con información genérica, qué pasa cuando necesita transferir a una persona, si queda transcripción y puntuación de cada llamada para medir resultados, y dónde se procesan los datos de tus clientes. Sectores como la hostelería, donde perder una reserva fuera de horario tiene un coste directo, son de los que más rápido notan el retorno de automatizar la atención telefónica con criterio.
En resumen
GPT-Live-1 y GPT-5.6 mejoran de forma real la parte que hasta ahora frenaba la adopción de voz IA en empresas: sonar natural y razonar mientras se habla. Pero llevar eso a una línea de atención al cliente en producción sigue siendo un proyecto de ingeniería, no una API que se enchufa sola. En Evicron ayudamos a evaluar si un proyecto de IA aplicada —agente de voz, chatbot o automatización— tiene sentido para tu volumen de llamadas antes de escribir una sola línea de código.
¿Pierdes llamadas o reservas fuera de horario? Cuéntanos tu caso: la primera consultoría es gratuita y respondemos en menos de 24 horas.