OpenAI ha aggiornato la propria API Realtime con nuove funzioni di intelligenza vocale pensate per creare applicazioni capaci di parlare, trascrivere e tradurre conversazioni in tempo reale. L’obiettivo è portare le interazioni vocali oltre il semplice scambio domanda-risposta, con modelli in grado di gestire richieste più complesse.
Le novità includono GPT-Realtime-2, un nuovo modello vocale con ragionamento di classe GPT-5, GPT-Realtime-Translate per la traduzione istantanea e GPT-Realtime-Whisper per la trascrizione live. OpenAI le indirizza soprattutto a customer service, istruzione, media ed eventi, ma anche a piattaforme creator.
OpenAI porta nella sua API nuove funzioni vocali per app in tempo reale
La Realtime API di OpenAI integra ora un pacchetto di strumenti vocali pensato per applicazioni che devono ascoltare, rispondere e agire mentre la conversazione è in corso. Il pezzo centrale è GPT-Realtime-2, un modello progettato per simulare una voce naturale e sostenere dialoghi più evoluti rispetto alla generazione precedente.
Rispetto a GPT-Realtime-1.5, il nuovo modello usa ragionamento di classe GPT-5, una scelta che punta a migliorare la gestione delle richieste più articolate. In pratica, OpenAI prova a spostare l’audio in tempo reale da una semplice interazione vocale a un’interfaccia capace di eseguire compiti concreti durante il flusso della conversazione.
- GPT-Realtime-2 è il nuovo modello vocale principale della serie Realtime.
- Il modello integra ragionamento di classe GPT-5 per richieste più complesse.
- Le funzioni vocali sono incluse nella Realtime API di OpenAI.
La nuova traduzione live copre più di 70 lingue in ingresso
Tra le novità più concrete c’è GPT-Realtime-Translate, pensato per tradurre conversazioni in tempo reale mantenendo il ritmo del dialogo. Il sistema supporta più di 70 lingue in ingresso e 13 lingue in uscita, cioè quelle che vengono effettivamente restituite all’utente.
Accanto alla traduzione arriva anche GPT-Realtime-Whisper, una funzione di trascrizione live che converte la voce in testo mentre l’interazione avviene. Per chi sviluppa assistenti, servizi di supporto o strumenti per eventi, si tratta della parte più immediatamente sfruttabile del pacchetto.
- GPT-Realtime-Translate supporta oltre 70 lingue in ingresso.
- Le lingue in uscita sono 13.
- GPT-Realtime-Whisper aggiunge la trascrizione vocale in tempo reale.
Le nuove funzioni vocali arrivano con tariffazione al minuto e per token
Sul fronte dei costi, Translate e Whisper vengono fatturati al minuto, mentre GPT-Realtime-2 segue una tariffazione basata sul consumo di token. Per chi valuta l’integrazione in un prodotto, il punto da monitorare è quindi il tipo di utilizzo: flussi lunghi e continui possono incidere in modo diverso rispetto a richieste più brevi.
OpenAI afferma anche di aver inserito protezioni per limitare abusi come spam, frodi o altre forme di uso improprio. Il sistema può interrompere le conversazioni se rileva violazioni delle linee guida sui contenuti dannosi, un aspetto importante visto che gli strumenti vocali in tempo reale possono essere utili anche in scenari facilmente esposti a rischio.
- GPT-Realtime-Translate e GPT-Realtime-Whisper sono fatturati al minuto.
- GPT-Realtime-2 è fatturato in base ai token.
- Sono presenti misure di protezione contro spam, frodi e abusi online.

