OpenAI

OpenAI aggiorna GPT Realtime 2.1: latenza p95 ridotta di almeno il 25%

OpenAI ha aggiornato la propria offerta Realtime per API con i nuovi modelli gpt-realtime-2.1 e gpt-realtime-2.1-mini, puntando soprattutto su interazioni vocali a bassa latenza e scenari multimodali. Il dato più rilevante è il calo della latenza p95 di almeno il 25%, ottenuto attraverso un’ottimizzazione del meccanismo di cache.

La metrica p95 indica il tempo entro cui rientra il 95% delle richieste, quindi è un riferimento concreto per capire quanto un sistema risponda in modo rapido e costante. Per applicazioni come assistenti vocali, agenti in tempo reale e interfacce conversazionali, questo aggiornamento può incidere direttamente sulla fluidità d’uso.

OpenAI 更新 2.1 系列 GPT Realtime AI 模型,p95 延迟至少降低 25%

OpenAI accelera i modelli Realtime 2.1 per voce e interazioni multimodali

I nuovi modelli sono pensati per agenti vocali con risposta rapida e per flussi che combinano più modalità di input. L’intervento sull’infrastruttura di cache permette di ridurre la latenza p95 di almeno il 25%, un miglioramento importante in tutte le applicazioni dove il tempo di risposta percepito fa la differenza.

In questo aggiornamento OpenAI distingue due livelli di prodotto: la versione mini, orientata a un equilibrio più aggressivo tra costo e funzionalità, e la versione standard, che aggiunge miglioramenti più estesi nella gestione della conversazione e nella comprensione dei segnali audio.

  • Nuovi modelli disponibili via API: gpt-realtime-2.1 e gpt-realtime-2.1-mini.
  • Riduzione della latenza p95 di almeno il 25% grazie all’ottimizzazione della cache.
  • Focus su agenti vocali in tempo reale e interazioni multimodali.
Ambito d’uso
Voce in tempo reale, testo e scenari multimodali
Il taglio della latenza p95 è il dato più concreto dell’update, perché incide direttamente sulla reattività percepita nelle conversazioni vocali.
La latenza p95 indica il valore entro cui si colloca il 95% delle richieste elaborate dal sistema.
Dati chiave dell’aggiornamento
Nuovi modelli
gpt-realtime-2.1, gpt-realtime-2.1-mini
Disponibilità
API OpenAI
Miglioramento dichiarato
p95 ridotta di almeno il 25%

gpt-realtime-2.1-mini supporta audio e testo in tempo reale con tool e function calling

La variante gpt-realtime-2.1-mini supporta input audio in tempo reale e input testuale, oltre a tool use e function calling. Un dettaglio interessante è la capacità di completare un ragionamento interno prima di eseguire un’azione, mantenendo però la continuità del dialogo con una breve spiegazione verbale preliminare.

Questo comportamento è utile nei casi in cui un agente deve interagire con strumenti esterni o attivare funzioni senza interrompere il flusso conversazionale. In pratica, il modello può risultare più naturale nell’uso operativo rispetto a un semplice motore speech-to-text o text-to-speech.

  • Supporto a input audio in tempo reale e testo.
  • Compatibile con tool use e function calling.
  • Può ragionare internamente prima di eseguire un’azione, preservando la continuità della conversazione.
Versione descritta
gpt-realtime-2.1-mini
Interazione
Conversazionale con esecuzione di azioni
La mini non è solo una variante più leggera: conserva funzioni chiave per costruire agenti vocali realmente operativi.
Funzioni principali di gpt-realtime-2.1-mini
Input supportati
Audio in tempo reale, testo
Tool use
Function calling

La versione standard migliora riconoscimento, gestione del rumore e livelli di ragionamento

Con gpt-realtime-2.1, OpenAI spinge anche sulla qualità del dialogo in condizioni meno ideali. Il modello migliora il riconoscimento alfanumerico, la gestione di silenzi e rumore, il trattamento delle interruzioni e l’aderenza alle istruzioni, tutti aspetti centrali per un assistente vocale più affidabile.

È inoltre disponibile una regolazione della forza di ragionamento su cinque livelli: minimal, low, medium, high e xhigh. L’impostazione predefinita è low e OpenAI suggerisce di partire proprio da questo livello negli ambienti di produzione dedicati agli agenti vocali.

  • Migliorato il riconoscimento alfanumerico.
  • Gestione più solida di silenzi, rumore e interruzioni.
  • Cinque livelli di ragionamento configurabili: minimal, low, medium, high, xhigh.
  • Valore predefinito: low.
Livelli di ragionamento
5
Preset consigliato
low per ambienti di produzione
La possibilità di regolare il livello di ragionamento dà più controllo sul compromesso tra velocità, comportamento e complessità dell’agente.
Miglioramenti dichiarati di gpt-realtime-2.1
Riconoscimento
Alfanumerico migliorato
Audio
Migliore gestione di silenzi e rumore
Conversazione
Gestione delle interruzioni e aderenza alle istruzioni
Ragionamento configurabile
minimal, low, medium, high, xhigh

I costi per token mostrano un’offerta articolata tra modelli standard, mini e input in cache

OpenAI ha indicato più fasce di prezzo per milione di token, con valori differenti tra input standard e input in cache. Nel dettaglio compaiono le seguenti coppie di costo: 4 dollari con cache a 0,40 dollari, 32 dollari con cache a 0,40 dollari, 5 dollari con cache a 0,50 dollari, 0,6 dollari con cache a 0,06 dollari, 10 dollari con cache a 0,30 dollari e 0,8 dollari con cache a 0,08 dollari.

La struttura conferma un posizionamento molto orientato all’uso API su larga scala, dove la cache può incidere sensibilmente sul costo finale. Per chi sviluppa agenti vocali continui o interazioni ripetitive, il rapporto tra latenza ridotta e input in cache resta uno dei punti più interessanti dell’aggiornamento.

  • Input a 4 dollari per milione di token, cache a 0,40 dollari.
  • Input a 32 dollari per milione di token, cache a 0,40 dollari.
  • Input a 5 dollari per milione di token, cache a 0,50 dollari.
  • Input a 0,6 dollari per milione di token, cache a 0,06 dollari.
  • Input a 10 dollari per milione di token, cache a 0,30 dollari.
  • Input a 0,8 dollari per milione di token, cache a 0,08 dollari.
Unità di prezzo
Costo per 1 milione di token
Voce ricorrente
Tariffe dedicate per input in cache
La cache non serve solo a velocizzare la risposta: in questa gamma Realtime pesa anche sul costo operativo complessivo.
Nel materiale diffuso i prezzi sono riportati in dollari e riferiti al consumo API per milione di token.
Tariffe riportate
Fascia 1
4 dollari input, 0,40 dollari cache
Fascia 2
32 dollari input, 0,40 dollari cache
Fascia 3
5 dollari input, 0,50 dollari cache
Fascia 4
0,6 dollari input, 0,06 dollari cache
Fascia 5
10 dollari input, 0,30 dollari cache
Fascia 6
0,8 dollari input, 0,08 dollari cache

Altre notizie da leggere

Condividi con i tuoi amici

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.

Verified by ExactMetrics