OpenAI ha portato GPT-Live-1 nelle API, aprendo agli sviluppatori l’accesso a un nuovo modello vocale pensato per interazioni in tempo reale. La novità più importante è l’integrazione tra comprensione e generazione della voce nello stesso modello, una scelta che riduce i passaggi intermedi e punta ad abbassare la latenza nelle conversazioni.
Il modello supporta dialoghi full duplex, quindi può ascoltare e parlare contemporaneamente, gestendo interruzioni, pause e rumore di fondo. È una base interessante soprattutto per chi lavora su assistenti telefonici, customer care e automazioni vocali che devono risultare più naturali rispetto ai tradizionali flussi basati su turni rigidi.

GPT-Live-1 punta a rendere le interazioni vocali più naturali e flessibili
L’architettura di GPT-Live-1 evita la classica catena separata tra riconoscimento vocale, modello linguistico e sintesi vocale. Unificando comprensione e output audio, OpenAI mira a contenere i ritardi e a migliorare la fluidità del dialogo, un aspetto cruciale quando l’assistente deve reagire in tempo reale senza sembrare meccanico.
Oltre alla conversazione live, il modello offre trascrizione vocale nativa e risposte testuali, con funzioni come comprensione di lettere e numeri, bias su parole chiave e rilevamento dei turni di parola.
Telefonate, strumenti esterni e passaggio a operatore sono i casi d’uso più concreti
Uno degli scenari più interessanti è quello telefonico. GPT-Live-1 può essere impiegato per prenotazioni, assistenza clienti e agenti vocali full duplex capaci di consultare sistemi aziendali, eseguire azioni autorizzate e, quando necessario, trasferire la conversazione a un operatore umano.
I primi riscontri indicano miglioramenti concreti. La piattaforma per l’apprendimento linguistico Speak ha registrato quasi l’80% in meno di interruzioni errate durante le pause di riflessione degli utenti rispetto a un sistema precedente basato sui turni.
API già attive, nuovi timbri vocali e costo base di 0
GPT-Live-1 è già disponibile via API. OpenAI indica per il solo livello vocale frontend un prezzo di 0,05 dollari al minuto, pari a circa 0,04 euro al minuto, quindi intorno a 2,5 euro l’ora. A questa cifra vanno però aggiunti gli eventuali costi del modello testuale di backend e degli strumenti usati dall’agente, quindi il costo finale dipende molto dal tipo di implementazione.
Sul fronte prestazionale, OpenAI riporta un vantaggio di 30 punti percentuali rispetto a GPT-Realtime-2.1 nel test Full Duplex Bench e il primo posto nei compiti end-to-end per agenti vocali Tau3 quando il sistema lavora insieme a GPT-6 Astra con ragionamento medio.
