OpenAI Privacy Filter foto editoriale

OpenAI API Realtime: nuove funzioni vocali con GPT-Realtime-2

OpenAI ha aggiornato la propria API Realtime con nuove funzioni di intelligenza vocale pensate per creare applicazioni capaci di parlare, trascrivere e tradurre conversazioni in tempo reale. L’obiettivo è portare le interazioni vocali oltre il semplice scambio domanda-risposta, con modelli in grado di gestire richieste più complesse.

Le novità includono GPT-Realtime-2, un nuovo modello vocale con ragionamento di classe GPT-5, GPT-Realtime-Translate per la traduzione istantanea e GPT-Realtime-Whisper per la trascrizione live. OpenAI le indirizza soprattutto a customer service, istruzione, media ed eventi, ma anche a piattaforme creator.

OpenAI porta nella sua API nuove funzioni vocali per app in tempo reale

La Realtime API di OpenAI integra ora un pacchetto di strumenti vocali pensato per applicazioni che devono ascoltare, rispondere e agire mentre la conversazione è in corso. Il pezzo centrale è GPT-Realtime-2, un modello progettato per simulare una voce naturale e sostenere dialoghi più evoluti rispetto alla generazione precedente.

Rispetto a GPT-Realtime-1.5, il nuovo modello usa ragionamento di classe GPT-5, una scelta che punta a migliorare la gestione delle richieste più articolate. In pratica, OpenAI prova a spostare l’audio in tempo reale da una semplice interazione vocale a un’interfaccia capace di eseguire compiti concreti durante il flusso della conversazione.

  • GPT-Realtime-2 è il nuovo modello vocale principale della serie Realtime.
  • Il modello integra ragionamento di classe GPT-5 per richieste più complesse.
  • Le funzioni vocali sono incluse nella Realtime API di OpenAI.
Scopo principale
Applicazioni vocali in tempo reale
Target prioritario
Developer e aziende
Ambiti citati
Customer service, istruzione, media, eventi e creator platform
OpenAI prova a rendere l’audio una vera interfaccia operativa: non solo ascolto e risposta, ma anche traduzione, trascrizione e azione mentre la conversazione continua.
Dettagli principali dei nuovi modelli vocali
GPT-Realtime-2
Modello vocale con ragionamento di classe GPT-5
GPT-Realtime-Translate
Traduzione vocale in tempo reale
GPT-Realtime-Whisper
Trascrizione speech-to-text live

La nuova traduzione live copre più di 70 lingue in ingresso

Tra le novità più concrete c’è GPT-Realtime-Translate, pensato per tradurre conversazioni in tempo reale mantenendo il ritmo del dialogo. Il sistema supporta più di 70 lingue in ingresso e 13 lingue in uscita, cioè quelle che vengono effettivamente restituite all’utente.

Accanto alla traduzione arriva anche GPT-Realtime-Whisper, una funzione di trascrizione live che converte la voce in testo mentre l’interazione avviene. Per chi sviluppa assistenti, servizi di supporto o strumenti per eventi, si tratta della parte più immediatamente sfruttabile del pacchetto.

  • GPT-Realtime-Translate supporta oltre 70 lingue in ingresso.
  • Le lingue in uscita sono 13.
  • GPT-Realtime-Whisper aggiunge la trascrizione vocale in tempo reale.
Traduzione
In tempo reale e conversazionale
Trascrizione
Speech-to-text live
Formato d’uso
Interazioni vocali mentre avvengono
OpenAI indica che le nuove funzioni sono pensate per contesti molto diversi, non solo per il supporto clienti: istruzione, media, eventi e piattaforme per creator rientrano tra gli usi citati.
Capacità linguistiche e di trascrizione
Lingue in ingresso
Oltre 70
Lingue in uscita
13
Trascrizione live
Sì, con GPT-Realtime-Whisper

Le nuove funzioni vocali arrivano con tariffazione al minuto e per token

Sul fronte dei costi, Translate e Whisper vengono fatturati al minuto, mentre GPT-Realtime-2 segue una tariffazione basata sul consumo di token. Per chi valuta l’integrazione in un prodotto, il punto da monitorare è quindi il tipo di utilizzo: flussi lunghi e continui possono incidere in modo diverso rispetto a richieste più brevi.

OpenAI afferma anche di aver inserito protezioni per limitare abusi come spam, frodi o altre forme di uso improprio. Il sistema può interrompere le conversazioni se rileva violazioni delle linee guida sui contenuti dannosi, un aspetto importante visto che gli strumenti vocali in tempo reale possono essere utili anche in scenari facilmente esposti a rischio.

  • GPT-Realtime-Translate e GPT-Realtime-Whisper sono fatturati al minuto.
  • GPT-Realtime-2 è fatturato in base ai token.
  • Sono presenti misure di protezione contro spam, frodi e abusi online.
Il pacchetto è interessante soprattutto per i servizi conversazionali e per le app che devono gestire voce, testo e traduzione nello stesso flusso, ma il modello di costo va valutato con attenzione in base al volume d’uso.
Condividi con i tuoi amici

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.

Verified by ExactMetrics