Costruiamo la nuova frontiera dell'IA agentica: ora in piena produzione.
Panoramica
NVIDIA Vera Rubin NVL72 unifica le tecnologie all'avanguardia di NVIDIA: 72 GPU Rubin, 36 CPU Vera, SuperNIC NVIDIA ConnectX™-9 e DPU BlueField™-4. Aumenta l'intelligenza in una piattaforma su scala rack con lo switch NVIDIA NVLink™ 6 e scala orizzontalmente con NVIDIA Quantum-X800 InfiniBand e Spectrum-X™ Ethernet per alimentare la rivoluzione industriale dell'IA su larga scala. Se distribuita con i rack NVIDIA Groq 3 LPX, Vera Rubin NVL72 offre una nuova classe di prestazioni di inferenza per modelli da trilioni di parametri e contesti da milioni di token.
Vera Rubin NVL72 è basato sul design del rack NVIDIA MGX™ NVL72 di terza generazione, offrendo una transizione fluida rispetto alle generazioni precedenti. Offre addestramento IA con un quarto delle GPU e inferenza IA a un decimo del costo per milione di token rispetto a NVIDIA Blackwell. Con il design di vassoi modulari senza cavi e il supporto di oltre 80 partner dell'ecosistema MGX, il supercomputer IA scalabile in rack offre prestazioni di livello mondiale con una distribuzione rapida.
Prestazioni
Prestazioni di inferenza LLM soggette a modifiche. Costo per 1 milione di token basato sul modello Kimi-K2-Thinking che utilizza 32K/8K ISL/OSL confrontando NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.
NVIDIA Vera Rubin NVL72 offre un decimo del costo per milione di token rispetto a NVIDIA GB200 NVL72 per l'IA agentica altamente interattiva e capace di ragionamento profondo.
NVIDIA Vera Rubin NVL72 offre fino a 10 volte più token per megawatt rispetto a NVIDIA GB200 NVL72, scalando l'intelligenza con lo stesso impatto energetico.
Prestazioni di inferenza LLM soggette a modifiche. Token al secondo per MW basati sul modello di pensiero Kimi-K2 che utilizza 32K/8K ISL/OSL che confronta NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.
Prestazioni previste soggette a modifica. Numero di GPU basate su un modello MoE da 10T addestrato su 100T token in un periodo di tempo fisso di 1 mese confrontando NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.
NVIDIA Vera Rubin NVL72 addestra modelli mixture-of-experts (MoE) con un quarto del numero di GPU rispetto a NVIDIA GB200 NVL72.
I sistemi agentici consumano fino a 15 volte più token rispetto alle applicazioni IA tradizionali. Le fabbriche IA devono offrire un volume di token ed enormi finestre contestuali con bassa latenza ed efficienza economica. In combinazione con LPX, Vera Rubin NVL72 offre un throughput per megawatt fino a 35 volte superiore per i modelli da mille miliardi di parametri.
Prestazioni previste soggette a modifica. A - Livello gratuito ($0): modello Qwen-3 da 235 miliardi di parametri con 32K token memorizzati in cache del valore chiave (KV). B - Livello medio ($3): modello Kimi K2.5 da 1 bilione di parametri con 128K token in cache KV. C - Livello alto ($6): modello GPT-MoE da 2 bilioni di parametri con 128K token memorizzati in cache KV. Livelli D - Premium ($45) e E - Ultra ($150): modello GPT-MoE da 2 bilioni di parametri con 400K token memorizzati in cache KV
Alimentare l'era degli agenti IA
La piattaforma Vera Rubin apre la prossima frontiera dell'IA agentica con cinque rack per scalare le fabbriche IA mondiali: NVIDIA Vera Rubin NVL72, CPU NVIDIA Vera, NVIDIA Groq 3 LPX, NVIDIA Vera BlueField-4 STX e NVIDIA Spectrum-6 SPX Ethernet. Progettati per operare insieme come un unico incredibile supercomputer IA, i rack alimentano ogni fase dell'IA, dal pre-addestramento su larga scala, passando per il post-addestramento e la scalabilità durante i test fino all'inferenza agentica in tempo reale.
NVIDIA Vera Rubin NVL4 offre prestazioni rivoluzionarie attraverso quattro GPU NVIDIA Rubin interconnesse da un bridge NVLink di seconda generazione che esegue NVIDIA NVLink di sesta generazione, in combinazione con due CPU NVIDIA Vera su NVLink-C2C. Compatibile con i server modulari NVIDIA MGX™ raffreddati a liquido, offre prestazioni fino a 4 volte superiori per la simulazione di calcolo scientifico, 6 volte superiori per l'addestramento AI-for-Science e 8 volte superiori per l'inferenza AI-for-Science rispetto a Grace Hopper.
Specifiche
| Fabbrica di IA basata su NVIDIA Vera Rubin NVL72¹ | |
|---|---|
| Configurazione delle dimensioni della fabbrica IA | 40.000 GPU NVIDIA Rubin con MaxLPS |
| Inferenza NVFP4² | 2 ZFLOPS |
| Addestramento NVFP4³ | 1,4 ZFLOPS |
| Addestramento FP8/FP6³ | 700 EFLOPS |
| FP16/BF16³ | 160 EFLOPS |
| TF32³ | 80 EFLOPS |
| Memoria GPU | Larghezza di banda | 12 PB HBM4 | 800 PB/s |
| Memoria CPU | Fino a 30 PB LPDDR5X |
| Memoria veloce | Fino a 42 PB |
| NVIDIA Vera Rubin NVL72 | Superchip NVIDIA Vera Rubin | GPU NVIDIA Rubin | |
|---|---|---|---|
| Configurazione | 72 GPU NVIDIA Rubin | 36 CPU NVIDIA Vera | 2 GPU NVIDIA Rubin | 1 CPU NVIDIA Vera | 1 GPU NVIDIA Rubin |
| Inferenza NVFP4² | 3.600 PFLOPS | 100 PFLOPS | 50 PFLOPS |
| Addestramento NVFP4³ | 2.520 PFLOPS | 70 PFLOPS | 35 PFLOPS |
| Addestramento FP8/FP6³ | 1.260 PFLOPS | 35 PFLOPS | 17,5 PFLOPS |
| FP16/BF16³ | 288 PFLOPS | 8 PFLOPS | 4 PFLOPS |
| TF32³ | 144 PFLOPS | 4 PFLOPS | 2 PFLOPS |
| FP32 | 9.360 TFLOPS | 260 TFLOPS | 130 TFLOPS |
| FP64 | 2.400 TFLOPS | 67 TFLOPS | 33 TFLOPS |
| Memoria GPU | Larghezza di banda | 20,7 TB HBM4 | 1.400 TB/s | 576 GB HBM4 | 38,5 TB/s | HBM4 da 288 GB | 19,2 TB/s |
| NVIDIA NVLink | Sesta generazione | ||
| Larghezza di banda NVLink | 216 TB/s |
6 TB/s | 3 TB/s |
| Larghezza di banda NVLink-C2C | 65 TB/s | 1,8 TB/s | - |
| Numero di core CPU | 3.168 core NVIDIA Olympus personalizzati | 6.336 thread | 88 core NVIDIA Olympus personalizzati 176 thread | - |
| Memoria CPU | Fino a 54 TB LPDDR5X | Fino a 1,5 TB LPDDR5X | - |
| Larghezza di banda di rete (scalabilità)⁴ | 32,4 TB/s | 0,9 TB/s | 0,45 TB/s |
| Totale chip NVIDIA + HBM4 | 1.296 | 30 | 12 |
| GPU a 100 MW¹ | 40K GPU | ||
| Temperatura di ingresso | 45°C | ||
1. Specifiche basate su una fabbrica di IA su vasta scala che utilizza NVIDIA DSX con MaxLPS.
2. Specifica sparsa.
3. Specifica densa.
4. Larghezza di banda bidirezionale.
Inizia
Iscriviti per ricevere le ultime notizie, gli aggiornamenti e altro da NVIDIA.