NVIDIA rilancia Rubin CPX

NVIDIA rilancia Rubin CPX: chip AI rivisto, più vicino a Rubin e con HBM4

NVIDIA avrebbe riattivato il progetto Rubin CPX, una GPU pensata per accelerare la fase di prefill nell’inferenza AI, ciòè l’elaborazione iniziale dell’input e la costruzione della cache KV prima della generazione vera e propria.

Il punto più interessante è il posizionamento tecnico. La nuova Rubin CPX viene descritta come molto vicina a una Rubin standard in termini di potenza di calcolo, ma con un’ottimizzazione più marcata proprio sul carico di prefill.

消息称英伟达重启推理预填充优化芯片 Rubin CPX 项目,设计大幅调整

Rubin CPX cambia impostazione e punta su memoria HBM4

Sul piano del chip, la nuova Rubin CPX viene accreditata di una potenza vicina a quella della Rubin tradizionale, ma con un passo avanti nelle prestazioni di prefill. Il consumo massimo per singola unità resterebbe molto elevato, pari a 2300 W, segno che NVIDIA continua a muoversi nel segmento data center più spinto, dove densità di calcolo e raffreddamento restano fattori decisivi.

La revisione più evidente riguarda la memoria: al posto della precedente impostazione con 128 GB di GDDR7, la nuova versione passerebbe a 168 GB di HBM4. È un salto rilevante perché sposta il prodotto verso una configurazione più adatta ai carichi AI ad alta intensità di banda, oltre a rendere Rubin CPX più coerente con scenari in cui il collo di bottiglia non è solo il calcolo puro.

L’architettura di sistema mostra un ruolo preciso accanto a Rubin standard

L’organizzazione dell’infrastruttura chiarisce bene la destinazione d’uso del progetto. Otto chip Rubin CPX formerebbero un compute tray, mentre otto tray costituirebbero un modulo rack con interconnessione orizzontale affidata a Spectrum-6 Ethernet in rame.

Rubin CPX utilizzerebbe inoltre un rack MGX ETL dedicato, con una configurazione da una a quattro unità rack modulari. A livello di piattaforma completa, l’indicazione sarebbe quella di abbinarla a Rubin standard con rapporto 1:1, collegando i rack Rubin CPX ETL ai rack Vera Rubin NVL72 tramite RDMA basata su Ethernet.

Perché Rubin CPX può diventare un tassello chiave per l’inferenza AI

La logica industriale dietro Rubin CPX è abbastanza chiara: oggi oltre metà del lavoro nell’inferenza AI si concentra nella preparazione dell’input e nella costruzione della cache KV. Spostare questo carico su una piattaforma dedicata può ridurre i costi operativi e rendere il deployment più elastico, evitando di usare in ogni fase le risorse più costose del sistema.

C’è poi un altro dato da considerare: ogni compute tray Rubin CPX arriverebbe a 1,34 TB di memoria HBM complessiva. Una capacità di questo tipo è particolarmente interessante per i carichi con contesto lungo, dove la memoria disponibile incide direttamente sulla fluidità del prefill e sulla gestione della cache.

Condividi con i tuoi amici

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.

Verified by ExactMetrics

Privacy e contenuti esterni

Puoi autorizzare i servizi esterni. Le nuove autorizzazioni si applicano subito; dopo una revoca la pagina viene ricaricata.

Leggi l'informativa sulla privacy