AI、ML、HPC のワークロードを実行するには、A4X、A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU)マシンを使用する AI 最適化 Compute Engine インスタンスとクラスタをデプロイします。大規模な AI クラスタと ML クラスタを実行できるこれらのマシンの機能の詳細については、クラスタ管理の概要をご覧ください。
A4X、A4、A3 Ultra、A3 Mega、A3 High(8 GPU)インスタンスは、Compute Engine から直接作成することも、Google Kubernetes Engine(GKE)などのマネージド サービスを介して作成することも、Cluster Toolkit などのデプロイ ツールを使用して作成することもできます。
ユースケースに適したコン��ューティング インスタンスまたはクラスタを作成するには、次のいずれかを選択します。
| オプション | ユースケース |
|---|---|
| Cluster Director | Slurm クラスタの設定と構成を自動化するフルマネージド サービスが必要である。Cluster Director は、クラスタのコンピューティング、ネットワーキング、ストレージ リソースを構成して、パフォーマンスを最大化し、ダウンタイムを最小限に抑えるのに役立ちます。詳細については、 AI ワークロード用のフルマネージド Slurm クラスタを作成するをご覧ください。 |
| Cluster Toolkit | Slurm クラスタと GKE クラスタの両方をデプロイするプロセスを簡素化するオープンソース ソフトウェアを使用したい。Cluster Toolkit は、高度なカスタマイズと拡張ができるように設計されています。ブループリントを使用して、ネットワーキング リソースとストレージ リソースをプロビジョニングできます。詳細については、以下をご覧ください。 |
| GKE | ワークロードのニーズに基づいて GKE クラスタを構成する際に、最大限の柔軟性を確保したい。詳細については、以下をご覧ください。 |
| Compute Engine を使用する | 独自のオーケストレーターを設定できるように、インフラストラクチャ レイヤを完全に制御したい。詳細については、以下をご覧ください。
|
次のステップ
- AI Hypercomputer のパフォーマンスが最適化されたインフラストラクチャについて学習する。