ブラウザ内AI推論を「最大60倍」速く Web AIランタイム「LiteRT.js」をGoogleが発表もうサーバはいらない(1/2 ページ)

Googleは、同社のオンデバイス推論ライブラリ「LiteRT」のJavaScriptバインディングである「LiteRT.js」を発表した。「TensorFlow」がルーツにあり、「PyTorch」「JAX」「Keras」といったフレームワークでも同様に高いパフォーマンスを発揮するという。

» 2026年08月18日 13時00分 公開
[@IT]

この記事は会員限定です。会員登録(無料)すると全てご覧いただけます。

 Googleは2026年7月9日(米国時間)、同社のオンデバイス推論ライブラリ「LiteRT」(Lite Runtimeの略)の「JavaScript」バインディングである「LiteRT.js」を発表した。この新しいランタイムにより、Web開発者はML(機械学習)モデルやAI(人工知能)モデルをローカルのWebブラウザで直接実行できるようになるという。

 LiteRT.jsの今回の初期リリースでは、新しいnpmパッケージや、運用例を紹介するデモ集など、導入に必要なツールが用意されている。

LiteRT.jsとは? LiteRTとは?

 LiteRT.jsは、本番環境のWebアプリケーションをターゲットとするGoogleの高性能なWeb AIランタイムだ。LiteRTスタックの延長線上にあり、さまざまなMLフレームワークに対応し、全てのプラットフォームにわたってコアランタイムを統一している。

 LiteRTは、オンデバイスAI向けの高性能ランタイム「TensorFlow Lite」(TFLite)から、2024年に名称変更されたもの。TFLiteは、ルーツであるTensorFlowフレームワークにとどまらず、「PyTorch」「JAX」「Keras」といったフレームワークで作成したモデルでも、同様に高いパフォーマンスを発揮するようになっていた。LiteRTへの名称変更は、このマルチフレームワーク対応の前進を踏まえて行われた。

 LiteRTは、エッジプラットフォーム上で高性能なMLモデルや生成AIモデルを展開するためのGoogleのオンデバイスフレームワークであり、効率的なモデル変換、ランタイム、最適化を提供する。TFLiteの次世代版として、数十億台のデバイスで稼働しているという。

LiteRT.jsの主な特徴

 LiteRT.jsを利用すると、開発者はJavaScriptや「TypeScript」で記述したアプリケーションにモデルを統合し、テキスト生成、物体検出、音声処理といった複雑なタスクを完全にクライアントサイドで処理できる。モデルをローカルで実行できるので、ユーザープライバシーの強化、サーバコストの排除、リアルタイム体験を支える超低遅延といったメリットが得られるという。

 GoogleはLiteRT.jsを、「.tflite」モデル(※)を実行可能なTensorFlow.jsからの強力な進化形と位置付けており、LiteRT.jsによってモバイルやデスクトップのブラウザへの展開が円滑になるとしている。

(※)

.tfliteは、TFLiteで使用されていたオンデバイスモデルの標準ファイルフォーマット。LiteRTにも標準フォーマットとして引き継がれている。


 TensorFlow.jsをはじめとする従来のWeb AI製品は、性能面で見劣りするJavaScriptベースのカーネルに依存していた。これに対し、LiteRT.jsは、Googleのネイティブなクロスプラットフォームランタイムを、その最適化とともにWebAssembly(Wasm)を通じてWeb開発者が直接利用できるようにする。

 LiteRTの変換フローとランタイムを活用することで、PyTorch、JAX、TensorFlowといったMLフレームワークからモデルを変換できる。CPU、GPU、NPU(Neural Processing Unit)にわたるネイティブなハードウェアアクセラレーションも利用できる。

PyTorchモデルの変換とカスタマイズ可能な量子化

 Pythonライブラリの「LiteRT Torch」を使えば、PyTorchモデルをワンステップで変換し、ブラウザベースの高度なハードウェアアクセラレーションをすぐに利用できる状態にできる。量子化ツールの「AI Edge Quantizer」により、モデルのレイヤーごとにカスタマイズした量子化スキームも設定でき、モデル全体の品質を維持しながら、大幅にサイズを削減し、性能を向上できる。

CPU、GPU、NPUにわたるネイティブなハードウェアアクセラレーション

 LiteRT.jsは以下のような多様なハードウェアバックエンドで、高性能なAI推論を可能にする。

  • CPU:Googleの高度に最適化されたオンデバイスCPUアクセラレーションライブラリ「XNNPACK」を利用する。堅牢(けんろう)なマルチスレッドサポートと、relaxed SIMD(Single Instruction, Multiple Data)ビルドを提供する
  • GPU:オンデバイスGPUアクセラレーションのためのGoogle製品「ML Drift」を採用し、WebGPU APIを活用して、Web上でアクセラレーションする
  • NPU:新しい「WebNN API」(現在、ChromeとEdgeで実験的に提供)を利用し、専用NPUをターゲットに、電力効率に優れた超低遅延の推論を可能にする

既存パイプラインの利用

 LiteRT.jsは、ネイティブにサポートされているTensorFlow.jsのテンソルを直接の入力および出力として解析することで、既存のTensorFlow.jsアーキテクチャとすぐに統合できる。

LiteRT.jsのアーキテクチャ概要(提供:Google
       1|2 次のページへ

Copyright © ITmedia, Inc. All Rights Reserved.

アイティメディアからのお知らせ

スポンサーからのお知らせPR

注目のテーマ

ID・パスワードから始める「引き算」のセキュリティ〜ゼロトラスト狂騒曲の果てに
その「AIコーディング」は本当に必要か?
Microsoft & Windows最前線2026
4AI by @IT - AIを作り、動かし、守り、生かす
ローコード/ノーコード セントラル by @IT - ITエンジニアがビジネスの中心で活躍する組織へ
Cloud Native Central by @IT - スケーラブルな能力を組織に
システム開発ノウハウ 【発注ナビ】PR
あなたにおすすめの記事PR

RSSについて

アイティメディアIDについて

メールマガジン登録

@ITのメールマガジンは、 もちろん、すべて無料です。ぜひメールマガジンをご購読ください。