Alibaba Cloud ha portato la serie Qwen-Audio-3.0 sulla piattaforma Qwen AI e su Alibaba Cloud Bailian, aggiungendo un tassello importante alla roadmap del brand sul fronte dei modelli vocali. La novità riguarda soprattutto gli sviluppatori, che ora possono accedere alle capacità della famiglia tramite API oppure con formula Token Plan.
Il punto interessante è che non si tratta di un singolo modello, ma di una gamma costruita per coprire riconoscimento vocale, sintesi e interazione in tempo reale.

Qwen-Audio-3.0 amplia l’offerta vocale di Alibaba
La serie Qwen-Audio-3.0 è composta da modelli vocali sviluppati internamente da Alibaba e organizzati per compiti distinti. Qwen-Audio-3.0-ASR converte la voce in testo ed è pensato per gestire anche contesti complessi e ambiti professionali; Qwen-Audio-3.0-TTS fa il percorso opposto, trasformando il testo in voce con supporto multilingua, più dialetti e controllo di emozione, tono e ritmo.
Accanto a questi c’è Qwen-Audio-3.0-Realtime, il modello più strategico della gamma perché punta all’interazione vocale end-to-end. Può ascoltare e rispondere in tempo reale, gestire interruzioni durante la conversazione, ricevere domande di follow-up e anche richiamare strumenti esterni.
Il primato nei benchmark rafforza il posizionamento della piattaforma
Alibaba sottolinea anche il risultato ottenuto da Qwen-Audio-3.0-Realtime nella classifica vocale di luglio pubblicata da Artificial Analysis, dove il modello ha raggiunto il primo posto globale in tre aree chiave: riconoscimento vocale, interazione in tempo reale e sintesi vocale. È un dato che pesa perché mette insieme i tre blocchi fondamentali dell’esperienza voce, e non solo una singola specializzazione.
Dal punto di vista pratico, questa mossa rafforza la continuità del marchio Qwen, che negli ultimi mesi ha esteso la propria presenza tra modelli aperti, strumenti cloud e applicazioni dirette.



