Rack Único NVIDIA Vera Rubin NVL72

NVIDIA Vera Rubin NVL72

Construindo a próxima fronteira da IA baseada em agentes — agora em produção total.

Visão Geral

Sete Novos Chips, Um Supercomputador de IA

O NVIDIA Vera Rubin NVL72 unifica tecnologias de ponta da NVIDIA: 72 GPUs Rubin, 36 CPUs Vera, SuperNICs NVIDIA ConnectX™-9 e DPUs BlueField™-4. Ele faz o escalonamento vertical da inteligência em uma plataforma em escala de rack com o switch NVIDIA NVLink™ 6 e o escalonamento horizontal com o NVIDIA Quantum-X800 InfiniBand e o Spectrum-X™ Ethernet para impulsionar a revolução industrial de IA em escala. Quando implantado com racks NVIDIA Groq 3 LPX, o Vera Rubin NVL72 oferece uma nova classe de desempenho de inferência para modelos de trilhões de parâmetros e contextos de milhões de tokens.

O Vera Rubin NVL72 é desenvolvido com base no design de rack NVIDIA MGX™ NVL72 de terceira geração, oferecendo uma transição perfeita das gerações anteriores. Ele oferece treinamento de IA com um quarto das GPUs e inferência de IA a um décimo do custo por milhão de tokens, em comparação com o NVIDIA Blackwell. Com designs de bandejas modulares sem cabos e suporte de mais de 80 parceiros do ecossistema MGX, o supercomputador de IA em escala de rack oferece desempenho de nível internacional com implantação rápida.

NVIDIA Vera Rubin Entra em Plena Produção para Impulsionar Fábricas de IA Baseada em Agentes em Todo o Mundo

O NVIDIA Vera Rubin está entrando em plena produção, com os principais fabricantes de servidores de Taiwan e líderes globais da cadeia de suprimentos produzindo em escala e enviando sistemas baseados no Vera Rubin, impulsionando laboratórios de IA, provedores de cloud e hiperescaladores na criação da inteligência de amanhã.

Governo do Japão, Líderes Industriais e NVIDIA lançam a primeira infraestrutura nacional de IA do mundo

A NVIDIA está trabalhando com a Noetra Corp. para lançar uma fábrica de IA NVIDIA Vera Rubin com 13.750 CPUs NVIDIA Vera e 27.500 GPUs NVIDIA Rubin para IA física nacional.

Desempenho

Ganhos Enormes de Eficiência em Treinamento e Inferência de IA

Desempenho de inferência de LLM sujeito a alterações. Custo por 1 milhão de tokens com base no modelo Kimi-K2-Thinking usando ISL/OSL de 32K/8K, comparando NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.

Redução dos Custos de Inferência.

O NVIDIA Vera Rubin NVL72 oferece um décimo do custo por milhão de tokens em comparação com o NVIDIA GB200 NVL72 para IA baseada em agentes altamente interativa e com raciocínio profundo.

Maximizando a Taxa de Processamento de Fábricas de IA

O NVIDIA Vera Rubin NVL72 oferece até dez vezes mais tokens por megawatt do que o NVIDIA GB200 NVL72, escalando a inteligência com a mesma utilização de energia.

Desempenho de inferência de LLM sujeito a alterações. Tokens por segundo por MW com base no modelo Kimi-K2 Thinking usando ISL/OSL de 32K/8K, comparando o NVIDIA GB200 NVL72 e o NVIDIA Vera Rubin NVL72.

Desempenho projetado sujeito a alterações. Número de GPUs com base em um modelo MoE de 10T treinado com 100T tokens em um prazo fixo de 1 mês, comparando o NVIDIA GB200 NVL72 e o NVIDIA Vera Rubin NVL72.

Aumento da Eficiência do Treinamento

O NVIDIA Vera Rubin NVL72 treina modelos mistura de especialistas (MoE) com um quarto do número de GPUs em comparação com o NVIDIA GB200 NVL72.

Taxa de Processamento 35 vezes Maior para Modelos com Trilhões de Parâmetros

Os sistemas baseados em agentes consomem até 15 vezes mais tokens do que as aplicações de IA tradicionais. As fábricas de IA devem atender ao volume de tokens e grandes janelas de contexto com baixa latência e economia eficiente. Quando combinado com o LPX, o NVIDIA Vera Rubin NVL72 oferece uma taxa de transferência por megawatt até 35 vezes maior para modelos de trilhões de parâmetros.

Desempenho projetado sujeito a alterações. Nível gratuito (US$ 0): modelo Qwen-3 com 235 bilhões de parâmetros com 32 mil tokens de cache KV. Nível intermediário (US$ 3): modelo Kimi K2.5 de 1 trilhão de parâmetros com 128 mil tokens de cache KV. Nível alto (US$ 6): modelo GPT-MoE de 2 trilhões de parâmetros com 128 mil tokens de cache KV. Níveis Premium (US$ 45) e Ultra (US$ 150): modelo GPT-MoE com 2 trilhões de parâmetros e 400 mil tokens de cache de chave-valor (KV).

Impulsionando a Era dos Agentes de IA

A Plataforma Vera Rubin

A plataforma Vera Rubin abre a próxima fronteira da IA baseada em agentes com cinco racks para escalar as fábricas de IA do mundo — NVIDIA Vera Rubin NVL72, CPU NVIDIA Vera, NVIDIA Groq 3 LPX, NVIDIA Vera BlueField-4 STX e NVIDIA Spectrum-6 SPX Ethernet. Projetados para operar juntos como um supercomputador de IA incrível, os racks impulsionam todas as fases da IA — desde o pré-treinamento em escala massiva, o pós-treinamento e o escalamento em tempo de testes até a inferência baseada em agentes em tempo real.

NVIDIA Vera Rubin NVL4

O NVIDIA Vera Rubin NVL4 oferece desempenho revolucionário por meio de quatro GPUs NVIDIA Rubin interconectadas por uma ponte NVLink de segunda geração executando o NVIDIA NVLink de sexta geração, combinado com duas CPUs NVIDIA Vera por meio do NVLink-C2C. Compatível com servidores modulares NVIDIA MGX™ com resfriamento líquido, ele oferece até 4 vezes mais desempenho para simulação de computação científica, 6 vezes mais para treinamento de IA para ciência e 8 vezes mais para inferência de IA para ciência em comparação com o Grace Hopper.

Especificações

Especificações de Fábrica de IA de 100 MW

  Fábrica de IA Baseada em NVIDIA Vera Rubin NVL72¹
Configuração do Tamanho da Fábrica de IA 40 mil GPUs NVIDIA Rubin com MaxLPS
Inferência NVFP4² 2 ZFLOPS
Treinamento NVFP4³ 1,4 ZFLOPS
Treinamento de FP8/FP6³ 700 EFLOPS
FP16/BF16³ 160 EFLOPS
TF32³ 80 EFLOPS
Memória da GPU | Largura de Banda 12 PB HBM4 | 800 PB/s
Memória da CPU Até 30 PB LPDDR5X
Memória Rápida Até 42 PB

Especificações do NVIDIA Vera Rubin NVL72

  NVIDIA Vera Rubin NVL72 Superchip NVIDIA Vera Rubin GPU NVIDIA Rubin
Configuração 72 GPUs NVIDIA Rubin | 36 CPUs NVIDIA Vera 2 GPUs NVIDIA Rubin | 1 CPU NVIDIA Vera 1 GPU NVIDIA Rubin
Inferência NVFP4² 3.600 PFLOPS 100 PFLOPS 50 PFLOPS
Treinamento NVFP4³ 2.520 PFLOPS 70 PFLOPS 35 PFLOPS
Treinamento de FP8/FP6³ 1.260 PFLOPS 35 PFLOPS 17,5 PFLOPS
FP16/BF16³ 288 PFLOPS 8 PFLOPS 4 PFLOPS
TF32³ 144 PFLOPS 4 PFLOPS 2 PFLOPS
FP32 9.360 TFLOPS 260 TFLOPS 130 TFLOPS
FP64 2.400 TFLOPS 67 TFLOPS 33 TFLOPS
Memória da GPU | Largura de Banda 20,7 TB HBM4 | 1.400 TB/s 576 GB HBM4 | 38,5 TB/s 288 GB HBM4 | 19,2 TB/s
NVIDIA NVLink Sexta Geração
Largura de Banda do NVLink 216 TB/s
6 TB/s 3 TB/s
Largura de banda do NVLink-C2C 65 TB/s 1,8 TB/s -
Contagem de Núcleos da CPU 3.168 núcleos NVIDIA Olympus personalizados | 6.336 threads 88 núcleos NVIDIA Olympus personalizados | 176 threads -
Memória da CPU Até 54 TB LPDDR5X Até 1,5 TB LPDDR5X -
Largura de Banda de Rede (Escalonamento Horizontal)⁴ 32,4 TB/s 0,9 TB/s 0,45 TB/s
Total de Chips NVIDIA + HBM4 1.296 30 12
GPUs em 100 MW¹ 40 mil GPUs
Temperatura de entrada 45°C

1. Especificações baseadas em uma fábrica de IA em escala usando o NVIDIA DSX com MaxLPS.
2. Especificação esparsa.
3. Especificação detalhada.
4. Largura de banda bidirecional.

Comece agora

Mantenha-se em Dia com as Notícias da NVIDIA

Inscreva-se para receber as últimas notícias, atualizações e novidades da NVIDIA.