Nvidia Blackwell GB300 segna un record nel pretraining MoE con 1648 TFLOPs per GPU

Nvidia Blackwell GB300 segna un record nel pretraining MoE con 1648 TFLOPs per GPU

Nvidia ha annunciato un nuovo risultato per la piattaforma Blackwell GB300, che ha stabilito un record nel pretraining di modelli MoE raggiungendo 1648 TFLOPs per GPU. Il test è stato eseguito con il modello DeepSeek-v3 671B su un sistema GB300 NVL72 con 256 GPU.

Il dato è interessante perché misura la capacità della nuova generazione Blackwell in uno scenario concreto di addestramento AI su larga scala. A parità di carico di training, GB300 NVL72 ha ottenuto le stesse prestazioni usando meno hardware rispetto ad altre configurazioni, segnalando un salto netto sul fronte dell’efficienza.

Blackwell GB300 alza il livello nel pretraining dei modelli MoE

MoE, ciòè Mixture of Experts o modello a miscela di esperti, è un’architettura che suddivide un grande modello in più sottoreti specializzate. Durante training e inferenza viene attivata solo una parte di questi esperti, così da aumentare la capacità complessiva del modello contenendo il costo computazionale. È una struttura sempre più usata nei grandi modelli linguistici proprio per migliorare l’efficienza.

Nel test condotto da Nvidia, il sistema GB300 NVL72 ha pre-addestrato il modello DeepSeek-v3 671B con 256 GPU, arrivando a una throughput per singola GPU di 1648 TFLOPs. In pratica, Blackwell GB300 non punta solo alla potenza grezza, ma a tradurre questa potenza in prestazioni reali su workload AI complessi e molto pesanti.

  • Record di 1648 TFLOPs per GPU nel pretraining MoE.
  • Test eseguito sul modello DeepSeek-v3 671B.
  • Configurazione impiegata: sistema GB300 NVL72 con 256 GPU.
  • A parità di attività di training, il sistema ha raggiunto lo stesso risultato con meno hardware.
Architettura testata
Blackwell GB300
Tipologia di workload
Pretraining di modello MoE
Il passaggio a 1648 TFLOPs per GPU colloca GB300 tra le piattaforme più aggressive per il training AI su larga scala.
Il pretraining è la fase in cui un modello apprende pattern generali da grandi quantità di dati non etichettati tramite apprendimento auto-supervisionato.
Dati chiave del test
Piattaforma
Nvidia GB300 NVL72
Numero di GPU
256
Modello utilizzato
DeepSeek-v3 671B
Prestazioni per GPU
1648 TFLOPs

Il salto rispetto a GB200 e ai test precedenti è molto netto

Nvidia indica che negli ultimi sei mesi ha simulato oltre 250.000 configurazioni differenti per affinare Blackwell, individuando 38 ottimizzazioni rilevanti e accumulando 1,4 milioni di ore di test GPU. Questo lavoro di ottimizzazione aiuta a spiegare perché il guadagno non dipenda solo dall’hardware, ma anche dalla messa a punto dell’intera piattaforma.

Rispetto a un test di pretraining precedente fermo a 1088 TFLOPs, il sistema GB300 NVL72 mostra un miglioramento del 50%. Il confronto con la generazione precedente è ancora più evidente: contro i 606 TFLOPs per GPU registrati da GB200, GB300 arriva a circa tre volte le prestazioni.

  • Oltre 250.000 configurazioni simulate per l’ottimizzazione.
  • Individuate 38 ottimizzazioni considerate di rilievo.
  • Completate 1,4 milioni di ore di test GPU.
  • Incremento del 50% rispetto al test a 1088 TFLOPs.
  • Balzo di circa 3 volte rispetto ai 606 TFLOPs per GPU di GB200.
Generazione precedente
GB200 a 606 TFLOPs per GPU
Periodo di lavoro sulle ottimizzazioni
Oltre 6 mesi
Il punto centrale non è solo il picco numerico, ma il fatto che GB300 riesca a mantenere prestazioni elevate nel pretraining di un modello da 671 miliardi di parametri.
Per chi segue l’hardware AI, questo risultato rafforza il posizionamento di Blackwell come piattaforma di riferimento per training ad alta densità e workload MoE.
Confronto prestazionale
GB300 NVL72 attuale
1648 TFLOPs per GPU
Test precedente
1088 TFLOPs per GPU
Variazione sul test precedente
+50%
GB200
606 TFLOPs per GPU
Vantaggio su GB200
Circa 3x

Altre notizie da leggere

Condividi con i tuoi amici

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.

Verified by ExactMetrics