Nvidia ha annunciato un nuovo risultato per la piattaforma Blackwell GB300, che ha stabilito un record nel pretraining di modelli MoE raggiungendo 1648 TFLOPs per GPU. Il test è stato eseguito con il modello DeepSeek-v3 671B su un sistema GB300 NVL72 con 256 GPU.
Il dato è interessante perché misura la capacità della nuova generazione Blackwell in uno scenario concreto di addestramento AI su larga scala. A parità di carico di training, GB300 NVL72 ha ottenuto le stesse prestazioni usando meno hardware rispetto ad altre configurazioni, segnalando un salto netto sul fronte dell’efficienza.
Blackwell GB300 alza il livello nel pretraining dei modelli MoE
MoE, ciòè Mixture of Experts o modello a miscela di esperti, è un’architettura che suddivide un grande modello in più sottoreti specializzate. Durante training e inferenza viene attivata solo una parte di questi esperti, così da aumentare la capacità complessiva del modello contenendo il costo computazionale. È una struttura sempre più usata nei grandi modelli linguistici proprio per migliorare l’efficienza.
Nel test condotto da Nvidia, il sistema GB300 NVL72 ha pre-addestrato il modello DeepSeek-v3 671B con 256 GPU, arrivando a una throughput per singola GPU di 1648 TFLOPs. In pratica, Blackwell GB300 non punta solo alla potenza grezza, ma a tradurre questa potenza in prestazioni reali su workload AI complessi e molto pesanti.
- Record di 1648 TFLOPs per GPU nel pretraining MoE.
- Test eseguito sul modello DeepSeek-v3 671B.
- Configurazione impiegata: sistema GB300 NVL72 con 256 GPU.
- A parità di attività di training, il sistema ha raggiunto lo stesso risultato con meno hardware.
Il salto rispetto a GB200 e ai test precedenti è molto netto
Nvidia indica che negli ultimi sei mesi ha simulato oltre 250.000 configurazioni differenti per affinare Blackwell, individuando 38 ottimizzazioni rilevanti e accumulando 1,4 milioni di ore di test GPU. Questo lavoro di ottimizzazione aiuta a spiegare perché il guadagno non dipenda solo dall’hardware, ma anche dalla messa a punto dell’intera piattaforma.
Rispetto a un test di pretraining precedente fermo a 1088 TFLOPs, il sistema GB300 NVL72 mostra un miglioramento del 50%. Il confronto con la generazione precedente è ancora più evidente: contro i 606 TFLOPs per GPU registrati da GB200, GB300 arriva a circa tre volte le prestazioni.
- Oltre 250.000 configurazioni simulate per l’ottimizzazione.
- Individuate 38 ottimizzazioni considerate di rilievo.
- Completate 1,4 milioni di ore di test GPU.
- Incremento del 50% rispetto al test a 1088 TFLOPs.
- Balzo di circa 3 volte rispetto ai 606 TFLOPs per GPU di GB200.





