Construindo a próxima fronteira da IA baseada em agentes — agora em produção total.
Visão Geral
O NVIDIA Vera Rubin NVL72 unifica tecnologias de ponta da NVIDIA: 72 GPUs Rubin, 36 CPUs Vera, SuperNICs NVIDIA ConnectX™-9 e DPUs BlueField™-4. Ele faz o escalonamento vertical da inteligência em uma plataforma em escala de rack com o switch NVIDIA NVLink™ 6 e o escalonamento horizontal com o NVIDIA Quantum-X800 InfiniBand e o Spectrum-X™ Ethernet para impulsionar a revolução industrial de IA em escala. Quando implantado com racks NVIDIA Groq 3 LPX, o Vera Rubin NVL72 oferece uma nova classe de desempenho de inferência para modelos de trilhões de parâmetros e contextos de milhões de tokens.
O Vera Rubin NVL72 é desenvolvido com base no design de rack NVIDIA MGX™ NVL72 de terceira geração, oferecendo uma transição perfeita das gerações anteriores. Ele oferece treinamento de IA com um quarto das GPUs e inferência de IA a um décimo do custo por milhão de tokens, em comparação com o NVIDIA Blackwell. Com designs de bandejas modulares sem cabos e suporte de mais de 80 parceiros do ecossistema MGX, o supercomputador de IA em escala de rack oferece desempenho de nível internacional com implantação rápida.
Desempenho
Desempenho de inferência de LLM sujeito a alterações. Custo por 1 milhão de tokens com base no modelo Kimi-K2-Thinking usando ISL/OSL de 32K/8K, comparando NVIDIA GB200 NVL72 e NVIDIA Vera Rubin NVL72.
O NVIDIA Vera Rubin NVL72 oferece um décimo do custo por milhão de tokens em comparação com o NVIDIA GB200 NVL72 para IA baseada em agentes altamente interativa e com raciocínio profundo.
O NVIDIA Vera Rubin NVL72 oferece até dez vezes mais tokens por megawatt do que o NVIDIA GB200 NVL72, escalando a inteligência com a mesma utilização de energia.
Desempenho de inferência de LLM sujeito a alterações. Tokens por segundo por MW com base no modelo Kimi-K2 Thinking usando ISL/OSL de 32K/8K, comparando o NVIDIA GB200 NVL72 e o NVIDIA Vera Rubin NVL72.
Desempenho projetado sujeito a alterações. Número de GPUs com base em um modelo MoE de 10T treinado com 100T tokens em um prazo fixo de 1 mês, comparando o NVIDIA GB200 NVL72 e o NVIDIA Vera Rubin NVL72.
O NVIDIA Vera Rubin NVL72 treina modelos mistura de especialistas (MoE) com um quarto do número de GPUs em comparação com o NVIDIA GB200 NVL72.
Os sistemas baseados em agentes consomem até 15 vezes mais tokens do que as aplicações de IA tradicionais. As fábricas de IA devem atender ao volume de tokens e grandes janelas de contexto com baixa latência e economia eficiente. Quando combinado com o LPX, o NVIDIA Vera Rubin NVL72 oferece uma taxa de transferência por megawatt até 35 vezes maior para modelos de trilhões de parâmetros.
Desempenho projetado sujeito a alterações. Nível gratuito (US$ 0): modelo Qwen-3 com 235 bilhões de parâmetros com 32 mil tokens de cache KV. Nível intermediário (US$ 3): modelo Kimi K2.5 de 1 trilhão de parâmetros com 128 mil tokens de cache KV. Nível alto (US$ 6): modelo GPT-MoE de 2 trilhões de parâmetros com 128 mil tokens de cache KV. Níveis Premium (US$ 45) e Ultra (US$ 150): modelo GPT-MoE com 2 trilhões de parâmetros e 400 mil tokens de cache de chave-valor (KV).
Impulsionando a Era dos Agentes de IA
A plataforma Vera Rubin abre a próxima fronteira da IA baseada em agentes com cinco racks para escalar as fábricas de IA do mundo — NVIDIA Vera Rubin NVL72, CPU NVIDIA Vera, NVIDIA Groq 3 LPX, NVIDIA Vera BlueField-4 STX e NVIDIA Spectrum-6 SPX Ethernet. Projetados para operar juntos como um supercomputador de IA incrível, os racks impulsionam todas as fases da IA — desde o pré-treinamento em escala massiva, o pós-treinamento e o escalamento em tempo de testes até a inferência baseada em agentes em tempo real.
O NVIDIA Vera Rubin NVL4 oferece desempenho revolucionário por meio de quatro GPUs NVIDIA Rubin interconectadas por uma ponte NVLink de segunda geração executando o NVIDIA NVLink de sexta geração, combinado com duas CPUs NVIDIA Vera por meio do NVLink-C2C. Compatível com servidores modulares NVIDIA MGX™ com resfriamento líquido, ele oferece até 4 vezes mais desempenho para simulação de computação científica, 6 vezes mais para treinamento de IA para ciência e 8 vezes mais para inferência de IA para ciência em comparação com o Grace Hopper.
Especificações
| Fábrica de IA Baseada em NVIDIA Vera Rubin NVL72¹ | |
|---|---|
| Configuração do Tamanho da Fábrica de IA | 40 mil GPUs NVIDIA Rubin com MaxLPS |
| Inferência NVFP4² | 2 ZFLOPS |
| Treinamento NVFP4³ | 1,4 ZFLOPS |
| Treinamento de FP8/FP6³ | 700 EFLOPS |
| FP16/BF16³ | 160 EFLOPS |
| TF32³ | 80 EFLOPS |
| Memória da GPU | Largura de Banda | 12 PB HBM4 | 800 PB/s |
| Memória da CPU | Até 30 PB LPDDR5X |
| Memória Rápida | Até 42 PB |
| NVIDIA Vera Rubin NVL72 | Superchip NVIDIA Vera Rubin | GPU NVIDIA Rubin | |
|---|---|---|---|
| Configuração | 72 GPUs NVIDIA Rubin | 36 CPUs NVIDIA Vera | 2 GPUs NVIDIA Rubin | 1 CPU NVIDIA Vera | 1 GPU NVIDIA Rubin |
| Inferência NVFP4² | 3.600 PFLOPS | 100 PFLOPS | 50 PFLOPS |
| Treinamento NVFP4³ | 2.520 PFLOPS | 70 PFLOPS | 35 PFLOPS |
| Treinamento de FP8/FP6³ | 1.260 PFLOPS | 35 PFLOPS | 17,5 PFLOPS |
| FP16/BF16³ | 288 PFLOPS | 8 PFLOPS | 4 PFLOPS |
| TF32³ | 144 PFLOPS | 4 PFLOPS | 2 PFLOPS |
| FP32 | 9.360 TFLOPS | 260 TFLOPS | 130 TFLOPS |
| FP64 | 2.400 TFLOPS | 67 TFLOPS | 33 TFLOPS |
| Memória da GPU | Largura de Banda | 20,7 TB HBM4 | 1.400 TB/s | 576 GB HBM4 | 38,5 TB/s | 288 GB HBM4 | 19,2 TB/s |
| NVIDIA NVLink | Sexta Geração | ||
| Largura de Banda do NVLink | 216 TB/s |
6 TB/s | 3 TB/s |
| Largura de banda do NVLink-C2C | 65 TB/s | 1,8 TB/s | - |
| Contagem de Núcleos da CPU | 3.168 núcleos NVIDIA Olympus personalizados | 6.336 threads | 88 núcleos NVIDIA Olympus personalizados | 176 threads | - |
| Memória da CPU | Até 54 TB LPDDR5X | Até 1,5 TB LPDDR5X | - |
| Largura de Banda de Rede (Escalonamento Horizontal)⁴ | 32,4 TB/s | 0,9 TB/s | 0,45 TB/s |
| Total de Chips NVIDIA + HBM4 | 1.296 | 30 | 12 |
| GPUs em 100 MW¹ | 40 mil GPUs | ||
| Temperatura de entrada | 45°C | ||
1. Especificações baseadas em uma fábrica de IA em escala usando o NVIDIA DSX com MaxLPS.
2. Especificação esparsa.
3. Especificação detalhada.
4. Largura de banda bidirecional.
Comece agora
Inscreva-se para receber as últimas notícias, atualizações e novidades da NVIDIA.