Zhonghao Xinying ha annunciato la nuova TPU proprietaria Xuyu, chip AI di nuova generazione pensato per carichi di training e inferenza ad alta densita. Il dato piu rilevante e la potenza di calcolo in floating point a precisione mista, che arriva a 896 TFLOPS per singolo chip, con un salto di 3 volte rispetto alla generazione precedente.
Insieme al chip debutta anche la piattaforma di calcolo Taize 2.0, costruita come unita standard per infrastrutture AI ad alte prestazioni. Il sistema integra 8 TPU e promette 7,168P di potenza complessiva a precisione mista, con consumi dichiarati pari all’80% di un server GPU tradizionale a parita di compito.

Xuyu punta su piu potenza per chip e inferenza 8-bit ad alta densita
Il nuovo acceleratore Xuyu e una TPU AI sviluppata internamente e progettata per scenari con grandi volumi di token e alta concorrenza in inferenza. Oltre ai 896 TFLOPS in floating point a precisione mista, il chip raggiunge 1792 TOPS in inferenza 8-bit, un dato che lo colloca chiaramente nel segmento delle soluzioni per grandi modelli linguistici e workload multimodali.
L’azienda indica anche un netto passo avanti sul fronte della memoria video e dell’interconnessione interna del chip, con supporto a contesti molto lunghi. La scheda ha un consumo nominale di 600 W e viene presentata come piu efficiente delle tradizionali soluzioni per il calcolo AI, con una riduzione dei consumi fino al 50%.
- Prestazioni a precisione mista per singolo chip fino a 896 TFLOPS
- Inferenza 8-bit fino a 1792 TOPS
- Prestazioni dichiarate triplicate rispetto al chip precedente Shana
- Supporto a contesti lunghi grazie a miglioramenti di memoria e interconnessione
- Potenza nominale per scheda di 600 W
Taize 2.0 combina 8 TPU in un nodo standard per training e deployment dei modelli
Taize 2.0 e la piattaforma di calcolo che accompagna il debutto del nuovo chip e rappresenta l’unita minima standard del sistema. La configurazione include due CPU ad alte prestazioni e 8 unita TPU, organizzate come un server CPU generale affiancato da un apparato dedicato all’accelerazione AI.
La potenza complessiva raggiunge 7,168P a precisione mista. Sul lato software la piattaforma punta sulla compatibilita piena con i framework AI piu usati, con supporto nativo a PyTorch, vLLM e SGLang, oltre all’adattamento dei carichi di training tramite DeepSpeed e Megatron-LM. Sono gia stati adattati numerosi modelli, inclusi Qwen, DeepSeek, GLM e MiniMAX, facilitando la migrazione dei progetti esistenti.
- Nodo standard composto da 2 CPU e 8 TPU
- Potenza complessiva di 7,168P a precisione mista
- Consumi dichiarati pari all’80% di un server GPU tradizionale sullo stesso compito
- Supporto nativo a PyTorch, vLLM e SGLang
- Compatibilita training con DeepSpeed e Megatron-LM
- Adattamento gia completato per decine di modelli linguistici e multimodali
Un lancio che guarda a indipendenza tecnologica e adozione enterprise
Uno degli elementi piu interessanti del lancio e l’approccio verticale: chip IP, set di istruzioni, librerie di accelerazione e software di sistema sono tutti sviluppati internamente. Questo riduce la dipendenza da tecnologie esterne e rende la proposta piu adatta a implementazioni enterprise dove continuita, controllo della piattaforma e conformita sono centrali.
Per chi segue il settore hardware AI, il lancio di Xuyu e Taize 2.0 e rilevante soprattutto per tre motivi concreti: aumento netto delle prestazioni per singolo chip, piattaforma gia pronta per l’uso con i framework piu diffusi e attenzione misurabile all’efficienza energetica. Restano da verificare sul campo prezzi, disponibilita commerciale e prestazioni in workload reali.
- Sviluppo interno di hardware e software della piattaforma
- Focus su settori regolamentati come finanza, energia e amministrazione
- Proposta completa per training, inferenza e migrazione modelli
