Rack singolo NVIDIA Vera Rubin NVL72

NVIDIA Vera Rubin NVL72

Costruiamo la nuova frontiera dell'IA agentica: ora in piena produzione.

Panoramica

Sette nuovi chip, un supercomputer IA

NVIDIA Vera Rubin NVL72 unifica le tecnologie all'avanguardia di NVIDIA: 72 GPU Rubin, 36 CPU Vera, SuperNIC NVIDIA ConnectX™-9 e DPU BlueField™-4. Aumenta l'intelligenza in una piattaforma su scala rack con lo switch NVIDIA NVLink™ 6 e scala orizzontalmente con NVIDIA Quantum-X800 InfiniBand e Spectrum-X™ Ethernet per alimentare la rivoluzione industriale dell'IA su larga scala. Se distribuita con i rack NVIDIA Groq 3 LPX, Vera Rubin NVL72 offre una nuova classe di prestazioni di inferenza per modelli da trilioni di parametri e contesti da milioni di token.

Vera Rubin NVL72 è basato sul design del rack NVIDIA MGX™ NVL72 di terza generazione, offrendo una transizione fluida rispetto alle generazioni precedenti. Offre addestramento IA con un quarto delle GPU e inferenza IA a un decimo del costo per milione di token rispetto a NVIDIA Blackwell. Con il design di vassoi modulari senza cavi e il supporto di oltre 80 partner dell'ecosistema MGX, il supercomputer IA scalabile in rack offre prestazioni di livello mondiale con una distribuzione rapida.

NVIDIA Vera Rubin entra in piena produzione per alimentare le fabbriche di IA agentica in tutto il mondo

NVIDIA Vera Rubin sta passando alla piena produzione, con i principali produttori di server di Taiwan e i leader globali della supply chain che producono e spediscono sistemi basati su Vera Rubin su larga scala, alimentando i laboratori IA, i fornitori di cloud e gli hyperscaler per creare l'intelligenza di domani.

Il governo giapponese, i leader industriali e NVIDIA lanciano la prima infrastruttura IA nazionale al mondo

NVIDIA sta collaborando con Noetra Corp. per lanciare una AI factory NVIDIA Vera Rubin dotata di 13.750 CPU NVIDIA Vera e 27.500 GPU NVIDIA Rubin destinata all'IA fisica nazionale.

Prestazioni

Enormi guadagni di efficienza nell'inferenza e nell'addestramento IA

Prestazioni di inferenza LLM soggette a modifiche. Costo per 1 milione di token basato sul modello Kimi-K2-Thinking che utilizza 32K/8K ISL/OSL confrontando NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.

Ridurre i costi dell'inferenza

NVIDIA Vera Rubin NVL72 offre un decimo del costo per milione di token rispetto a NVIDIA GB200 NVL72 per l'IA agentica altamente interattiva e capace di ragionamento profondo.

Massimizzare il throughput delle fabbriche IA

NVIDIA Vera Rubin NVL72 offre fino a 10 volte più token per megawatt rispetto a NVIDIA GB200 NVL72, scalando l'intelligenza con lo stesso impatto energetico.

Prestazioni di inferenza LLM soggette a modifiche. Token al secondo per MW basati sul modello di pensiero Kimi-K2 che utilizza 32K/8K ISL/OSL che confronta NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.

Prestazioni previste soggette a modifica. Numero di GPU basate su un modello MoE da 10T addestrato su 100T token in un periodo di tempo fisso di 1 mese confrontando NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.

Aumentare l'efficienza dell'addestramento

NVIDIA Vera Rubin NVL72 addestra modelli mixture-of-experts (MoE) con un quarto del numero di GPU rispetto a NVIDIA GB200 NVL72.

Produttività 35 volte superiore per i modelli da mille miliardi di parametri

I sistemi agentici consumano fino a 15 volte più token rispetto alle applicazioni IA tradizionali. Le fabbriche IA devono offrire un volume di token ed enormi finestre contestuali con bassa latenza ed efficienza economica. In combinazione con LPX, Vera Rubin NVL72 offre un throughput per megawatt fino a 35 volte superiore per i modelli da mille miliardi di parametri.

Prestazioni previste soggette a modifica. A - Livello gratuito ($0): modello Qwen-3 da 235 miliardi di parametri con 32K token memorizzati in cache del valore chiave (KV). B - Livello medio ($3): modello Kimi K2.5 da 1 bilione di parametri con 128K token in cache KV. C - Livello alto ($6): modello GPT-MoE da 2 bilioni di parametri con 128K token memorizzati in cache KV. Livelli D - Premium ($45) e E - Ultra ($150): modello GPT-MoE da 2 bilioni di parametri con 400K token memorizzati in cache KV

Alimentare l'era degli agenti IA

La piattaforma Vera Rubin

La piattaforma Vera Rubin apre la prossima frontiera dell'IA agentica con cinque rack per scalare le fabbriche IA mondiali: NVIDIA Vera Rubin NVL72, CPU NVIDIA Vera, NVIDIA Groq 3 LPX, NVIDIA Vera BlueField-4 STX e NVIDIA Spectrum-6 SPX Ethernet. Progettati per operare insieme come un unico incredibile supercomputer IA, i rack alimentano ogni fase dell'IA, dal pre-addestramento su larga scala, passando per il post-addestramento e la scalabilità durante i test fino all'inferenza agentica in tempo reale.

NVIDIA Vera Rubin NVL4

NVIDIA Vera Rubin NVL4 offre prestazioni rivoluzionarie attraverso quattro GPU NVIDIA Rubin interconnesse da un bridge NVLink di seconda generazione che esegue NVIDIA NVLink di sesta generazione, in combinazione con due CPU NVIDIA Vera su NVLink-C2C. Compatibile con i server modulari NVIDIA MGX™ raffreddati a liquido, offre prestazioni fino a 4 volte superiori per la simulazione di calcolo scientifico, 6 volte superiori per l'addestramento AI-for-Science e 8 volte superiori per l'inferenza AI-for-Science rispetto a Grace Hopper.

Specifiche

Specifiche della fabbrica di IA da 100 MW

  Fabbrica di IA basata su NVIDIA Vera Rubin NVL72¹
Configurazione delle dimensioni della fabbrica IA 40.000 GPU NVIDIA Rubin con MaxLPS
Inferenza NVFP4² 2 ZFLOPS
Addestramento NVFP4³ 1,4 ZFLOPS
Addestramento FP8/FP6³ 700 EFLOPS
FP16/BF16³ 160 EFLOPS
TF32³ 80 EFLOPS
Memoria GPU | Larghezza di banda 12 PB HBM4 | 800 PB/s
Memoria CPU Fino a 30 PB LPDDR5X
Memoria veloce Fino a 42 PB

Specifiche di NVIDIA Vera Rubin NVL72

  NVIDIA Vera Rubin NVL72 Superchip NVIDIA Vera Rubin GPU NVIDIA Rubin
Configurazione 72 GPU NVIDIA Rubin | 36 CPU NVIDIA Vera 2 GPU NVIDIA Rubin | 1 CPU NVIDIA Vera 1 GPU NVIDIA Rubin
Inferenza NVFP4² 3.600 PFLOPS 100 PFLOPS 50 PFLOPS
Addestramento NVFP4³ 2.520 PFLOPS 70 PFLOPS 35 PFLOPS
Addestramento FP8/FP6³ 1.260 PFLOPS 35 PFLOPS 17,5 PFLOPS
FP16/BF16³ 288 PFLOPS 8 PFLOPS 4 PFLOPS
TF32³ 144 PFLOPS 4 PFLOPS 2 PFLOPS
FP32 9.360 TFLOPS 260 TFLOPS 130 TFLOPS
FP64 2.400 TFLOPS 67 TFLOPS 33 TFLOPS
Memoria GPU | Larghezza di banda 20,7 TB HBM4 | 1.400 TB/s 576 GB HBM4 | 38,5 TB/s HBM4 da 288 GB | 19,2 TB/s
NVIDIA NVLink Sesta generazione
Larghezza di banda NVLink 216 TB/s
6 TB/s 3 TB/s
Larghezza di banda NVLink-C2C 65 TB/s 1,8 TB/s -
Numero di core CPU 3.168 core NVIDIA Olympus personalizzati | 6.336 thread 88 core NVIDIA Olympus personalizzati 176 thread -
Memoria CPU Fino a 54 TB LPDDR5X Fino a 1,5 TB LPDDR5X -
Larghezza di banda di rete (scalabilità)⁴ 32,4 TB/s 0,9 TB/s 0,45 TB/s
Totale chip NVIDIA + HBM4 1.296 30 12
GPU a 100 MW¹ 40K GPU
Temperatura di ingresso 45°C

1. Specifiche basate su una fabbrica di IA su vasta scala che utilizza NVIDIA DSX con MaxLPS.
2. Specifica sparsa.
3. Specifica densa.
4. Larghezza di banda bidirezionale.

Inizia

Aggiornati con le notizie di NVIDIA

Iscriviti per ricevere le ultime notizie, gli aggiornamenti e altro da NVIDIA.