AI

2026.10.02 09:13

AIクラウドプロバイダーにとって、ストレージが推論効率を左右する時代へ

Adobe Stock

Adobe Stock

AIクラウドプロバイダーにとって、ストレージが推論効率を左右する時代へ

コンピュートはスタックのなかで多くのプロバイダーが積極的に取り組んでいる部分だ。推論においては、その下の層がフリート全体で処理できる量を同じくらい大きく左右する。

AIクラウド事業者が集まる場で、ストレージが自社ビジネスにとって何を意味するかと尋ねれば、答えはある幅のなかに散らばる。

一方の端ではコストとして管理すべきもの、すなわちGPUの隣に居座るオーバーヘッドであり、1テラバイトあたりの価格で評価され、ワークロードが許す限り切り詰められるものだ。もう一方の端ではイネーブラー(能力を引き出す存在)であり、確かにテナントに販売する容量ではあるが、主にその下にあるアクセラレーターをどれだけ生産的にするかで評価される。

ほとんどのプロバイダーはその中間のどこかに位置しており、具体的にどこかは答える人によって変わる。しかし、デル・テクノロジーズ(Dell)が取引しているプロバイダーのなかで、最も持続性のあるビジネスを築いているのは、2つ目の端寄りに位置する傾向にある。そこには実務的な理由がある。ストレージをイネーブラーとして扱えば、ストレージが支えるGPUと同じ土俵で議論されることになり、フリートが実際に何をできるかに関する意思決定はまさにそこで行われるからだ。

かつて、GPUの生産性を高めることは、データをいかに素早くGPUへ届けるかという問題であった。これは主にモデルの学習(トレーニング)段階で解決されたパイプラインの課題だった。現在、この課題は推論そのものへと広がっている。そのため、成功しているプロバイダーの評価基準は、保有するGPUの数だけではなく、実際のテナントが稼働した後に各GPUが1日にどれだけの仕事をこなすかへと移行している。すなわち、同時に何セッションを保持できるか、誰かのコンテキストが長くなった際にどれだけ素早く応答できるか、そして、すでに完了した作業の再実行ではなく出力の生成にどれだけ時間を使えるか、である。これが推論効率だ。

プロバイダーはテナントが何を実行するかを予測できない

推論効率をプロバイダーの立場で設計するのは、ほかの誰にとってよりも難しい。やってくる仕事を自分で計画する余地がないからだ。自社モデルを運用する企業であれば、セッションのおおよその姿を把握している。プロバイダーはそうではない。これがサービスプロバイダー事業における真の設計上の制約だ。フリートは、それが担う仕事の姿が誰にもわからないうちに購入され構築される。

キャパシティプランニングは助けになるが、どんな予測もテナントが来四半期に何を実行するかを教えてはくれない。プロバイダーの手の内にあるのは、インフラがどれだけ自身をうまく活用するか、すなわちシステムの各部がそれぞれ設計された本来の仕事を行っているか、ほかの場所に属するはずの仕事を吸収していないか、という点だ。ここでストレージがアーキテクチャ上の意思決定として立ち現れる。

GPUメモリがコンテキストの唯一の居場所になるとき

AIシステムで最も高価な一等地は、GPUに直接接続されたメモリだ。高速で、プロセッサに物理的に近く、容量は多くない。モデルが応答を能動的に生成している最中は、まさにそこがコンテキストの居場所である。トークン単位でGPUを満たし続けられるほど近い場所はほかにないからだ。難しいのは、セッションが静かになったが終わってはいない状態になったときに、そのコンテキストをどうするかである。

このコンテキストとは、KVキャッシュ(キー・バリュー・キャッシュ)のことである。これは、トークンごとに再計算を行う必要がないように手元に残しておく、モデルがそのセッションでこれまでに算出した内容の進行中の記録である。すべてをGPUメモリに置いておくのはセッションが短かった時代には理にかなっていた。だが、テナントが長時間のセッションにわたって文書履歴やツール出力、推論の連鎖を抱えるエージェントを稼働させ、同じプロンプトや参照資料を1日に何千回も通すようになった今では、維持が難しくなっている。GPUメモリがコンテキストの唯一の居場所であるとき、プロバイダーに残された選択肢は2つ、保持するか、捨てるかだ。

通常起きるのは捨てることだ。メモリが満杯になり、システムは古いコンテキストを破棄し、セッションが再びそれを必要とすればモデルが再計算する。この再計算は、一度完了済みの作業を、ほかの誰かにサービスを提供できたはずの計算能力を使って、2度目に行うことである。負荷下では応答時間が伸び、トークンスループットが低下する。

これはGPUの失敗でも、それに接続されたメモリの失敗でもない。両者とも設計された通りの仕事をしている。足りないのは、現在能動的に使われてはいないが再び必要となるコンテキストの行き場、すなわちGPUメモリよりは遅く、ゼロから計算し直すよりは遥かに速い場所である。

コンテキストに別の居場所を与える

解決策は地味で、だからこそ注目を集めるのに時間がかかったのだろう。能動的なコンテキストはGPUメモリに置いたまま本来あるべき場所にとどめ、その背後にあるすべてには、推論が要求する速度で保持・返却するために設計されたストレージという住処を与えるのだ。

これにより、何も捨てられず、何も再計算される必要がない。能動的に使われていないコンテキストは、それを保持するために構築されたインフラへと移される。そしてGPUは、本来の役割である自分にしかできない計算処理のためにメモリを取り戻す。それは応答時間の短縮と、GPUあたりの対応ユーザー数の増加として現れる。

共有ストレージ、個別のテナント

コンテキストを共有ストレージ上に移すことは、マルチテナントのフリートを運営する人なら誰もが抱く明白な疑問を呼ぶ。誰と共有するのか、どのように分離するのか、である。これは極めて真っ当な問いであり、適切なストレージアーキテクチャの選択がなぜ重要かという理由でもある。

まず前者から。GPUメモリ内のコンテキストは、1つのノード上の1つのセッションとともに生まれ、消える。ストレージ内のコンテキストはそれを超えて持続し、そのテナントに次にサービスを提供するノードが引き継ぐことができる。再訪したユーザー、再開されたセッション、1日の作業のなかで何度も参照される文書、それぞれがすでにそこにあるものから開始され、何千というセッションを通じて、フリートが二度繰り返す必要のない作業となる。これが持つ価値のある共有であり、テナントの境界で止まる。

アクセスゾーンは、デルのファイルストレージがその線を保つ仕組みだ。各ゾーンは独自の認証境界を持つクラスターのパーティションであり、分離は仮定ではなく強制される。クラスターがサポートするゾーン数は、そのクラスター上で分離されたコンテキストを保持できるテナント数の上限であり、その上限は現在500である。テナントのトラフィックはTLS(Transport Layer Security)上で実行可能で、共有ネットワーク上のほかのものが転送中に読み取ることはできない。ゾーン内では、テナントが自己管理する。それぞれ独自のクォータ(容量制限)を持ち、あるチームの長時間稼働エージェントが別のチームが頼りにしている容量を使い果たすことはない。また、プロバイダーへのサポート要求ではなくKubernetesから直接、独自のスナップショットスケジュールとリストアを管理できる。

これが、サービスプロバイダーの規模でコンテキストのオフロードを実用的にする仕組みだ。コンテキストはテナントのために持続し、テナントの内側にとどまり、そのテナントにサービスを提供するあらゆるGPUがメモリを取り戻す。

イネーブラーとしてのストレージ

ここでのストレージは、コンピュートの代わりを務めているわけでも、予算を奪い合っているわけでもない。GPUの皿から仕事を1つ下ろし、GPUが固有に得意な仕事をより多くできるようにしている。両者は並んで動き、システム全体の性能は両方に依存する。ストレージがその地位を得るのは、統合を通じてだ。何を再利用するかを決定するサービング・ルーティングソフトウェア、それを運ぶネットワークファブリック、そしてCPUを完全にバイパスしてGPUメモリへと至る直接経路との統合である。ストレージは倉庫というよりはメモリの拡張のように振る舞い、GPUが再計算するよりも速くコンテキストを返却する必要がある。そうできるストレージはもはや、フリートの下に置かれる単なる容量ではない。それは推論の実行方法の一部となる。

すべては、先ほどのスペクトルの両端に戻る。ストレージをGPUの下の一項目として扱うか、それともGPUを生産的にする要素の一部として扱うか、である。この先数年について、プロバイダーが主にどれだけのアクセラレーテッドコンピュートを確保できるかで競う未来像もある。そして私の見方では、より可能性が高いもう1つの未来像では、プロバイダーがすでに持っているものからどれだけのサービスを提供できるかで競うことになる。

後者の未来では、ストレージをイネーブラーとみなす視点が報われる。このように構築されたフリートは、体験が劣化し始める前に、テナントが投げかけてくるものをより多く吸収できる。

デルはAIストレージを、コンピュートの下の層としてではなく、推論効率をますます左右するイネーブラーとして構築している。Dell AI Data PlatformのストレージエンジンであるPowerScale、ObjectScale、Lightningが、ファイル、オブジェクト、パラレルファイルをまたいでGPUダイレクト経路でコンテキストをGPUメモリから共有ストレージへと移し、クエリ応答時間を短縮しトークンスループットを向上させる仕組みについて、続きをお読みいただきたい。デルとNVIDIAがその背後にあるアーキテクチャをさらに深掘りするFrom Ambition to AI at Scaleはこちらから登録できる。

(forbes.com 原文)

タグ:

advertisement

ForbesBrandVoice

人気記事