OpenAI porta GPT-Live-1 nelle API foto live

OpenAI porta GPT-Live-1 nelle API: voce in tempo reale e agenti telefonici

OpenAI ha portato GPT-Live-1 nelle API, aprendo agli sviluppatori l’accesso a un nuovo modello vocale pensato per interazioni in tempo reale. La novità più importante è l’integrazione tra comprensione e generazione della voce nello stesso modello, una scelta che riduce i passaggi intermedi e punta ad abbassare la latenza nelle conversazioni.

Il modello supporta dialoghi full duplex, quindi può ascoltare e parlare contemporaneamente, gestendo interruzioni, pause e rumore di fondo. È una base interessante soprattutto per chi lavora su assistenti telefonici, customer care e automazioni vocali che devono risultare più naturali rispetto ai tradizionali flussi basati su turni rigidi.

OpenAI 扩大实时语音模型能力:GPT-Live-1 上线 API,支持打断处理、工具调用和电话语音智能体

GPT-Live-1 punta a rendere le interazioni vocali più naturali e flessibili

L’architettura di GPT-Live-1 evita la classica catena separata tra riconoscimento vocale, modello linguistico e sintesi vocale. Unificando comprensione e output audio, OpenAI mira a contenere i ritardi e a migliorare la fluidità del dialogo, un aspetto cruciale quando l’assistente deve reagire in tempo reale senza sembrare meccanico.

Oltre alla conversazione live, il modello offre trascrizione vocale nativa e risposte testuali, con funzioni come comprensione di lettere e numeri, bias su parole chiave e rilevamento dei turni di parola.

Telefonate, strumenti esterni e passaggio a operatore sono i casi d’uso più concreti

Uno degli scenari più interessanti è quello telefonico. GPT-Live-1 può essere impiegato per prenotazioni, assistenza clienti e agenti vocali full duplex capaci di consultare sistemi aziendali, eseguire azioni autorizzate e, quando necessario, trasferire la conversazione a un operatore umano.

I primi riscontri indicano miglioramenti concreti. La piattaforma per l’apprendimento linguistico Speak ha registrato quasi l’80% in meno di interruzioni errate durante le pause di riflessione degli utenti rispetto a un sistema precedente basato sui turni.

API già attive, nuovi timbri vocali e costo base di 0

GPT-Live-1 è già disponibile via API. OpenAI indica per il solo livello vocale frontend un prezzo di 0,05 dollari al minuto, pari a circa 0,04 euro al minuto, quindi intorno a 2,5 euro l’ora. A questa cifra vanno però aggiunti gli eventuali costi del modello testuale di backend e degli strumenti usati dall’agente, quindi il costo finale dipende molto dal tipo di implementazione.

Sul fronte prestazionale, OpenAI riporta un vantaggio di 30 punti percentuali rispetto a GPT-Realtime-2.1 nel test Full Duplex Bench e il primo posto nei compiti end-to-end per agenti vocali Tau3 quando il sistema lavora insieme a GPT-6 Astra con ragionamento medio.

Condividi con i tuoi amici

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.

Verified by ExactMetrics

Privacy e contenuti esterni

Puoi autorizzare i servizi esterni. Le nuove autorizzazioni si applicano subito; dopo una revoca la pagina viene ricaricata.

Leggi l'informativa sulla privacy