AIはもう「NVIDIA一強」ではない d-Matrixの創業者が語るAI推論のダイナミクス:学習と推論が逆転する世界(2/2 ページ)
AIでは推論ニーズが急拡大していく見通しだ。このトレンドは、AIアクセラレーターの世界をどう変えていくのだろうかか、推論特化型チップがNVIDIAのビジネスを侵食していくのか。実はそれほど単純な話ではない。有力スタートアップ企業、d-Matrixの共同創業者兼CEOに聞いた。
そこでd-Matrixは2026年9月に「Raptor」という新アーキテクチャを発表した。Raptorでは3D DRAMをSRAMベースのアクセラレーターのダイに統合し、単一パッケージを構成している。1枚のカードのDRAM容量は32GB。DDR接続ではなく、DRAMと演算ダイを直接接続することで、データ転送の遅延を大幅に抑えている。
AIモデルの大型化は、メモリだけでなくチップ間の接続でも課題を生む。シェイス氏は、メモリ帯域とメモリ容量に加え、I/Oが大きなボトルネックになっていると指摘する。
「モデルが大きくなり、コンテキスト長も長くなっている。多くのユーザーに対応しながら、大量のデータやコンテキストを扱うには、どうしても多数のチップを接続しなければならない。I/Oが次の大きな課題になっている」
同社はこれまで、PCIeを使ってスケールアップ構成を実現してきた。Raptorではさらに、NVIDIAのNVLink Fusionを採用し、NVIDIAのラックアーキテクチャに統合できるようにする。NVLinkによる高速・低遅延のチップ間接続を利用することで、Raptorを多数接続した大規模な推論システムへとスケールさせることが可能になる。
「GPU対推論チップ」という構図ではない
今後は「AI=NVIDIA GPU」とは限らない。だが、GPUが大規模なAI処理で果たす役割は引き続き大きい。
LLMの推論は、実は上述の説明より複雑だ。入力されたプロンプトを処理する「Prefill(プリフィル)」と、応答を1トークンずつ生成する「Decode(デコード)」という2つの段階に分けられる。
Prefillは入力をまとめて処理するため計算負荷が大きく、GPUが得意とする。一方、Decodeはユーザーに対して応答を逐次返す処理であり、応答の間隔を短くするために低遅延が重要になる。
この特性の違いを生かし、PrefillをGPU、Decodeを推論チップで処理する組み合わせ(「ディスアグリゲーション」と呼ばれる)が広がっており、d-Matrixチップの主な利用構成の一つでもあるとシェイス氏は話す。
この構成には、既存のGPU資産を活用できるというメリットもある。
「古いGPU群にd-Matrixを追加すれば、そのGPUの推論性能を引き上げられる。新しいGPUを購入する代わりに、既存のGPUをより長く使うこともできる」
AIエージェントの利用が進展するにつれ、GPUと推論チップを組み合わせる構成がますます重要になる。
AIエージェントでは、複数のエージェントが役割を分担し、互いに情報を受け渡しながら処理を進める構成が考えられる。エージェント間のやりとりが増えれば、個々の応答速度がシステム全体の処理時間に影響する。また、エージェントが長いコンテキストや大量のデータを扱う場合には、メモリ容量も重要になる。
「エージェントの一部をGPU上でPrefillとして動かし、別の部分をわれわれのハードウェアで動かすことができる。メモリやコンテキストをどこに置くかなど、さまざまなディスアグリゲーションの方法がある」
簡単に言えば、AIの今後は「ハイブリッド」だということだ。
シェイス氏は、NVIDIAとの連携を深めてGPUとのハイブリッド構成を推進し、データセンター向けAI推論チップ市場で半数のシェア獲得を目指すとしている。NVIDIAも、自社プラットフォームのAI推論向け機能・性能を強化する一方、外部の推論チップを組み込めるようにすることで、AIインフラ全体を支える統合基盤としての価値を高めようとしている。
Copyright © ITmedia, Inc. All Rights Reserved.