エージェント型 AI の次のフロンティアを構築 - 現在、量産段階に進んでいます。
概要
NVIDIA Vera Rubin NVL72 は、72 基の Rubin GPU、36 基の Vera CPU、NVIDIA ConnectX™-9 SuperNIC、および BlueField™-4 DPU など、NVIDIA の最先端テクノロジーを統合しています。これは、NVIDIA NVLink™ 6 スイッチを搭載したラックスケール プラットフォームでインテリジェンスを拡張し、NVIDIA Quantum-X800 InfiniBand と Spectrum-X™ イーサネット によるスケールアウトを実現することで、大規模な AI 産業革命を推進します。 NVIDIA Groq 3 LPX ラックと併せてデプロイすることで、Vera Rubin NVL72 は、1 兆パラメータのモデルや 100 万トークンのコンテキスト向けに、新たなレベルの推論パフォーマンスを実現します。
Vera Rubin NVL72 は、第 3 世代 NVIDIA MGX™ NVL72 ラック設計を基盤に構築されており、前世代からのシームレスな移行を実現します。NVIDIA Blackwell と比較して、GPU の使用数を 4 分の 1 に抑えながら AI トレーニングを実行し、AI 推論を 100 万トークンあたり 10 分の 1 のコストで実現します。このラックスケール AI スーパーコンピューターは、ケーブル不要のモジュラー トレイ設計を採用し、80 社以上の MGX エコシステム パートナーのサポートにより、迅速なデプロイで世界トップクラスのパフォーマンスを提供します。
パフォーマンス
LLM 推論パフォーマンスは変更される場合があります。 32K/8K ISL/OSL を使用した Kimi-K2-Thinking モデルに基づく 100 万トークンあたりのコストを、NVIDIA GB200 NVL72 と NVIDIA Vera Rubin NVL72 を比較したものです。
NVIDIA Vera Rubin NVL72 は、NVIDIA GB200 NVL72 と比較して、高度にインタラクティブで深層リーズニング型のエージェント型 AI において 100 万トークンあたりのコストを 10 分の 1 に抑えます。
NVIDIA Vera Rubin NVL72 は、NVIDIA GB200 NVL72 と比較して、メガワットあたりで最大 10 倍のトークン数を実現し、同じ電力フットプリント内でインテリジェンスを拡張できます。
LLM 推論パフォーマンスは変更される場合があります。 NVIDIA GB200 NVL72 と NVIDIA Vera Rubin NVL72 を比較した 32K/8K ISL/OSL を使用した Kimi-K2 思考モデルに基づく MW あたり 1 秒あたりのトークン数。
パフォーマンスの予測値は変更される場合があります。NVIDIA GB200 NVL72 と NVIDIA Vera Rubin NVL72 を比較し、1 か月間の固定期間内に 100T トークンでトレーニングされた 10T MoE モデルを基盤とする GPU の数。
NVIDIA Vera Rubin NVL72 は、NVIDIA GB200 NVL72 と比較して 4 分の 1 の GPU 数で混合エキスパート (MoE) モデルをトレーニングします。
エージェント型システムは、従来の AI アプリケーションと比較して、最大 15 倍のトークンを処理します。 AI ファクトリーは、低遅延と高い経済効率を維持しながら、大量のトークン処理と大規模なコンテキスト ウィンドウに対応する必要があります。 LPX と組み合わせることで、Vera Rubin NVL72 は、1 兆パラメータ級モデルにおいて、メガワットあたり最大 35 倍のスループットを実現します。
パフォーマンスの予測値は変更される場合があります。無料ティア ($0): 32K KV キャッシュ トークンを備えた Qwen-3 2350 億パラメータ モデル。ミディアム ティア ($3): 128K KV キャッシュ トークンを備えた Kimi K2.5 1 兆パラメータ モデル。ハイ ティア ($6): 128K KV キャッシュ トークンを備えた GPT-MoE 2 兆パラメータ モデル。プレミアム ($45) および Ultra ($150) ティア: 400K KV キャッシュ トークンを備えた GPT-MoE 2 兆パラメータ モデル。
AI エージェントの時代を推進
Vera Rubin プラットフォームは、世界の AI ファクトリーを拡張できる 5 つのラック (NVIDIA Vera Rubin NVL72、NVIDIA Vera CPU、NVIDIA Groq 3 LPX、NVIDIA Vera BlueField-4 STX、NVIDIA Spectrum-6 SPX イーサネット) により、エージェント型 AI の新たなフロンティアを切り拓きます。 1 つの驚異的な AI スーパーコンピューターとして連携して動作するように設計されたこれらのラックは、大規模な事前学習、事後学習、テスト時間のスケーリングからリアルタイムのエージェント型推論に至るまで、AI のあらゆるフェーズを支えます。
NVIDIA Vera Rubin NVL4 は、第 6 世代 NVIDIA NVLink を実行する第 2 世代 NVLink ブリッジによって相互接続された 4 基の NVIDIA Rubin GPU と、NVLink-C2C を介して接続された 2 基の NVIDIA Vera CPU を組み合わせることで、画期的なパフォーマンスを実現します。液冷式の NVIDIA MGX™ モジュール式サーバーに対応しており、Grace Hopper と比較して、科学計算シミュレーションで最大 4 倍、AI-for-Science トレーニングで 6 倍、AI-for-Science 推論で 8 倍のパフォーマンスを実現します。
仕様
| NVIDIA Vera Rubin NVL72 ベースの AI ファクトリー¹ | |
|---|---|
| AI ファクトリーのサイズ構成 | MaxLPS を搭載した 40K NVIDIA Rubin GPU |
| NVFP4 推論² | 2 ZFLOPS |
| NVFP4 トレーニング³ | 1.4 ZFLOPS |
| FP8/FP6 トレーニング³ | 700 EFLOPS |
| FP16/BF16³ | 160 EFLOPS |
| TF32³ | 80 EFLOPS |
| GPU メモリ | 帯域幅 | 12 PB HBM4 | 800 PB/秒 |
| CPU メモリ | 最大 30 PB LPDDR5X |
| 高速メモリ | 最大 42 PB |
| NVIDIA Vera Rubin NVL72 | NVIDIA Vera Rubin Superchip | NVIDIA Rubin GPU | |
|---|---|---|---|
| 構成 | 72 基の NVIDIA Rubin GPU | 36 基の NVIDIA Vera CPU | 2 基の NVIDIA Rubin GPU | 1 基の NVIDIA Vera CPU | 1 基の NVIDIA Rubin GPU |
| NVFP4 推論² | 3,600 PFLOPS | 100 PFLOPS | 50 PFLOPS |
| NVFP4 トレーニング³ | 2,520 PFLOPS | 70 PFLOPS | 35 PFLOPS |
| FP8/FP6 トレーニング³ | 1,260 PFLOPS | 35 PFLOPS | 17.5 PFLOPS |
| FP16/BF16³ | 288 PFLOPS | 8 PFLOPS | 4 PFLOPS |
| TF32³ | 144 PFLOPS | 4 PFLOPS | 2 PFLOPS |
| FP32 | 9,360 TFLOPS | 260 TFLOPS | 130 TFLOPS |
| FP64 | 2,400 TFLOPS | 67 TFLOPS | 33 TFLOPS |
| GPU メモリ | 帯域幅 | 20.7 TB HBM4 | 1,400 TB/秒 | 576 GB HBM4 | 38.5 TB/秒 | 288 GB HBM4 | 19.2 TB/秒 |
| NVIDIA NVLink | 第 6 世代 | ||
| NVLink 帯域幅 | 216 TB/秒 |
6 TB/秒 | 3 TB/秒 |
| NVLink-C2C 帯域幅 | 65 TB/秒 | 1.8 TB/秒 | - |
| CPU コア数 | 3,168 個のカスタム NVIDIA Olympus コア | 6,336 スレッド | 88 個のカスタム NVIDIA Olympus コア | 176 スレッド | - |
| CPU メモリ | 最大 54 TB LPDDR5X | 最大 1.5 TB LPDDR5X | - |
| ネットワーク帯域幅 (スケールアウト)⁴ | 32.4 TB/秒 | 0.9 TB/秒 | 0.45 TB/秒 |
| NVIDIA + HBM4 チップの合計 | 1,296 | 30 | 12 |
| 100 MW 環境における GPU¹ | 40K GPU | ||
| 吸気温度 | 45°C | ||
1. MaxLPS を搭載した NVIDIA DSX を使用する実規模の AI ファクトリーに基づく仕様。
2. Sparse 仕様。
3. Dense 仕様。
4. 双方向の帯域幅。
今すぐ始める
NVIDIA から最新情報やニュースなどを受け取るにはご登録ください。