Bastidor único NVIDIA Vera Rubin NVL72

NVIDIA Vera Rubin NVL72

Construyendo la próxima frontera de la IA de agentes: ya en plena producción.

Descripción

Siete nuevos chips, un superordenador de IA

NVIDIA Vera Rubin NVL72 unifica las tecnologías de vanguardia de NVIDIA: 72 GPU Rubin, 36 CPU Vera, SuperNICs NVIDIA ConnectX™-9 y DPU BlueField™-4. Escala la inteligencia en una plataforma a escala de bastidor con el conmutador NVIDIA NVLink™ 6 y escala horizontalmente con NVIDIA Quantum-X800 InfiniBand y Spectrum-X™ Ethernet para impulsar la revolución industrial de la IA a escala. Cuando se implementa con los bastidores NVIDIA Groq 3 LPX, Vera Rubin NVL72 proporciona un nuevo nivel de rendimiento en inferencia para modelos con un billón de parámetros y contextos con millones de tókenes.

Vera Rubin NVL72 se basa en el diseño de bastidor NVIDIA MGX™ NVL72 de tercera generación, lo que ofrece una transición fluida desde las generaciones anteriores. Proporciona entrenamiento de IA con una cuarta parte de las GPU e inferencia de IA a una décima parte del coste por millón de tókenes en comparación con NVIDIA Blackwell. Con diseños de bandejas modulares sin cables y soporte de más de 80 partners del ecosistema MGX, el superordenador de IA a escala de bastidor proporciona un rendimiento de clase mundial con una implementación rápida.

NVIDIA Vera Rubin entra en producción completa para impulsar las fábricas de IA de agentes en todo el mundo

NVIDIA Vera Rubin está entrando en producción completa, con los principales fabricantes de servidores de Taiwán y líderes globales de la cadena de suministro fabricando a escala y suministrando sistemas basados en Vera Rubin, impulsando laboratorios de IA, proveedores de nube e hiperescaladores para crear la inteligencia del mañana.

El Gobierno de Japón, los líderes del sector y NVIDIA lanzan la primera infraestructura de IA nacional del mundo

NVIDIA colabora con Noetra Corp. para lanzar una fábrica de IA NVIDIA Vera Rubin con 13 750 CPU NVIDIA Vera y 27 500 GPU NVIDIA Rubin para la IA física nacional.

Rendimiento

Aumento enorme de eficiencia en el entrenamiento y la inferencia de IA

El rendimiento de inferencia de LLM está sujeto a cambios. Coste por 1 millón de tokens basado en el modelo Kimi-K2-Thinking que utiliza 32K/8K ISL/OSL y compara NVIDIA GB200 NVL72 y NVIDIA Vera Rubin NVL72.

Reducción de costes de inferencia

El coste de NVIDIA Vera Rubin NVL72 por millón de tokens es la décima parte del de NVIDIA GB200 NVL72 para la IA de agentes de razonamiento profundo altamente interactiva.

Maximización del rendimiento de la fábrica de IA

NVIDIA Vera Rubin NVL72 proporciona hasta 10 veces más tokens por megavatio que NVIDIA GB200 NVL72, lo que permite ampliar la inteligencia con la misma huella energética.

El rendimiento de inferencia de LLM está sujeto a cambios. Tókenes por segundo por MW basados en el modelo Kimi-K2 Thinking que utiliza 32K/8K ISL/OSL en comparación con NVIDIA GB200 NVL72 y NVIDIA Vera Rubin NVL72.

El rendimiento proyectado está sujeto a cambios. Número de GPU basado en un modelo de mezcla de expertos (MoE) de 10 billones entrenado en 100 billones de tókenes en un periodo de tiempo fijo de 1 mes en comparación con NVIDIA GB200 NVL72 y NVIDIA Vera Rubin NVL72.

Aumentar la eficiencia del entrenamiento

NVIDIA Vera Rubin NVL72 entrena modelos de mezcla de expertos (MoE) con la cuarta parte de unidades GPU que NVIDIA GB200 NVL72.

Rendimiento 35 veces superior en modelos con billones de parámetros

Los sistemas de agentes consumen hasta 15 veces más tókenes que las aplicaciones de IA tradicionales. Las fábricas de IA deben ofrecer un gran volumen de tókenes y ventanas de contexto masivas con baja latencia y una economía eficiente. Cuando se combina con LPX, Vera Rubin NVL72 proporciona un rendimiento por megavatio hasta 35 veces superior en modelos con un billón de parámetros.

El rendimiento proyectado está sujeto a cambios. A - Nivel gratuito (0 $): Modelo Qwen-3 con 235 000 millones de parámetros con 32 000 tókenes de valor clave (KV) en caché. B - Nivel medio (3 $): modelo Kimi K2.5 de 1 billón de parámetros con 128 000 tókenes de valor clave (KV) almacenados en caché. C - Nivel alto (6 $): modelo GPT-MoE de 2 billones de parámetros con 128 000 tókenes de valor clave (KV) almacenados en caché. D - Niveles Prémium (45 $) y Ultra (150 $): modelo GPT-MoE de 2 billones de parámetros con 400 000 tókenes de valor clave (KV) almacenados en caché

Potenciar la era de los agentes de IA

La plataforma Vera Rubin

La plataforma Vera Rubin abre la puerta a la próxima frontera de la IA de agentes con cinco bastidores para escalar las fábricas de IA del mundo: NVIDIA Vera Rubin NVL72, CPU NVIDIA Vera, NVIDIA Groq 3 LPX, NVIDIA Vera BlueField-4 STX y NVIDIA Spectrum-6 SPX Ethernet. Los bastidores, diseñados para funcionar conjuntamente como un increíble superordenador de IA, impulsan cada fase de la IA, desde el preentrenamiento a escala masiva, el posentrenamiento y el escalado en tiempo de pruebas hasta la inferencia de agentes en tiempo real.

NVIDIA Vera Rubin NVL4

NVIDIA Vera Rubin NVL4 proporciona un rendimiento revolucionario a través de cuatro GPU NVIDIA Rubin interconectadas por un puente NVLink de segunda generación que ejecuta NVIDIA NVLink de sexta generación, junto con dos CPU NVIDIA Vera a través de NVLink-C2C. Es compatible con los servidores modulares NVIDIA MGX™ con refrigeración por líquido y proporciona un rendimiento hasta 4 veces superior para la simulación de computación científica, 6 veces para el entrenamiento de IA para la ciencia y 8 veces para la inferencia de IA para la ciencia en comparación con Grace Hopper.

Especificaciones

Especificaciones de una fábrica de IA de 100 MW

  Fábrica de IA basada en NVIDIA Vera Rubin NVL72¹
Configuración de tamaño de fábricas de IA 40 000 GPU NVIDIA Rubin con MaxLPS
Inferencia de NVFP4² 2 ZETTAFLOPS
Entrenamiento de NVFP4³ 1,4 ZETTAFLOPS
Entrenamiento de FP8/FP6³ 700 EFLOPS
FP16/BF16³ 160 EFLOPS
TF32³ 80 EFLOPS
Memoria de la GPU | Ancho de banda 12 PB HBM4 | 800 PB/s
Memoria de la CPU Hasta 30 PB LPDDR5X
Memoria rápida Hasta 42 PB

Especificaciones de NVIDIA Vera Rubin NVL72

  NVIDIA Vera Rubin NVL72 Superchip NVIDIA Vera Rubin GPU NVIDIA Rubin
Configuración 72 GPU NVIDIA Rubin | 36 CPU NVIDIA Vera 2 GPU NVIDIA Rubin | 1 CPU NVIDIA Vera 1 GPU NVIDIA Rubin
Inferencia de NVFP4² 3600 PFLOPS 100 PFLOPS 50 PFLOPS
Entrenamiento de NVFP4³ 2520 PFLOPS 70 PFLOPS 35 PFLOPS
Entrenamiento de FP8/FP6³ 1260 PFLOPS 35 PFLOPS 17,5 PFLOPS
FP16/BF16³ 288 PFLOPS 8 PETAFLOPS 4 PETAFLOPS
TF32³ 144 PFLOPS 4 PETAFLOPS 2 PFLOPS
FP32 9360 TERAFLOPS 260 TERAFLOPS 130 TERAFLOPS
FP64 2400 TERAFLOPS 67 TERAFLOPS 33 TERAFLOPS
Memoria de la GPU | Ancho de banda 20,7 TB HBM4 | 1400 TB/s 576 GB HBM4 | 38,5 TB/s 288 GB HBM4 | 19,2 TB/s
NVIDIA NVLink Sexta generación
Ancho de banda de NVLink 216 TB/s
6 TB/s 3 TB/s
Ancho de banda de NVLink-C2C 65 TB/s 1,8 TB/s -
Cantidad de núcleos de CPU 3168 núcleos NVIDIA Olympus personalizados | 6336 subprocesos 88 núcleos NVIDIA Olympus personalizados | 176 subprocesos -
Memoria de la CPU Hasta 54 TB LPDDR5X Hasta 1,5 TB LPDDR5X -
Ancho de banda de red (escalado horizontal)⁴ 32,4 TB/s 0,9 TB/s 0,45 TB/s
Total de chips NVIDIA + HBM4 1296 30 12
GPU en 100 MW¹ 40 000 GPU
Temperatura de entrada 45 °C

1. Especificaciones basadas en una fábrica de IA a escala que utiliza NVIDIA DSX con MaxLPS.
2. Especificación dispersa.
3. Especificación densa.
4. Ancho de banda bidireccional.

Empezar

Manténgase al día sobre las noticias de NVIDIA

Suscríbase para obtener las últimas noticias, actualizaciones y mucho más de NVIDIA.