• Strataは、1250億パラメータのAI「Qwen3.8-Flash-Next」を普通のゲーミングPCで動かすソフトです
  • VRAM(グラフィックボードのメモリ)12GBのRTX 5070で、最大毎秒94トークンの速度が公開されています
  • よく使う専門家だけをGPUに置き、残りをメモリとCPUに任せる分担方式で動かします
  • 必要なのはVRAM 12GB以上、メインメモリ32〜64GB、SSDの空き約80GBです
  • 速度は開発者が公開した数字で、第三者による検証はまだ限られています

数百GBのメモリが要るはずの巨大AIが、ゲーミングPCで動く。そんな話を聞いたら、本当だろうかと思いませんか。

この記事では、MITライセンスで公開された「Strata」の仕組みと速度、動かす条件、注意点を順に説明します。

Strataとは何か

Strata(ストラータ)は、開発者のNiko1221氏がGitHubで公開した推論エンジンです。推論エンジンとは、完成したAIモデルを実際に動かして答えを出させるソフトのことです。

対象は、Alibabaの「Qwen3.8-Flash-Next」というモデルです。MITライセンスなので、自由に使って改変できます。ただしモデル本体のライセンスは別です。

起動すると、パソコンの中に127.0.0.1:8080というローカルAPIが立ち上がります。OpenAI互換とAnthropic互換の両方に対応しているため、既存のAIコーディングツールをつなげます。ほかに、ブラウザのチャット画面と画像の入力があります。

データは自分のパソコンの外に出ません。入力した文章や社内のコードが外部に送られないのは、ローカルAIの大きな利点です。

対象モデル「Qwen3.8-Flash-Next」の中身

Hugging Faceのモデルページによると、言語モデル部分のパラメータ数は1250億です。ところが、1つの単語を作るときに実際に使うのは約60億ぶんにすぎません。

これはMoE(Mixture of Experts)という作り方によるものです。MoEは、得意分野の違う小さな専門家をたくさん用意しておき、単語ごとに必要な何人かだけを呼ぶ仕組みです。

このモデルは48層で、各層に512人の専門家がいます。合計で2万4,576人です。1つの単語を作るときに使われるのは、そのうち10人と共通の専門家1人だけです。

文脈の長さは26万2,144トークンで、拡張すれば100万トークンまで伸ばせます。ライセンスは「qwen-community-1.0」と表示されています。商用で使う場合は、利用条件を自分で確認してください。

なぜ12GBのGPUで動くのか

ふつうは、1250億パラメータのモデルがGPUのメモリに載りません。そこでStrataは、専門家の置き場所を3か所に分けています。

GPU・メモリ・SSDの分担

仕組みを説明した公式文書によると、役割分担は次のとおりです。

GPUには、全単語で必ず使う部分と、よく使われる専門家を置きます。メインメモリには、2万4,576人の専門家をすべて置きます。

GPUにいない専門家が必要になったときは、CPUの出番です。この計算はGPUの計算と同時に進むので、待ち時間が出にくくなります。

巨大な参照表(n-gram表)は、約28.8GBでSSDに置きます。単語ごとに読むのは数行だけなので、SSDの負担は小さくなります。

図書館にたとえると、よく借りられる本は手元の机、全部の蔵書は書庫、巨大な索引は別館に置く分け方です。

先読みで1.6〜1.8倍に

もう1つの工夫が、投機的デコーディングです。モデルに組み込まれた小さな助手が、次の数単語を先に予想します。大きなモデルは、その予想をまとめて1回で検算します。

最終的な答えを決めるのは大きなモデルです。そのため、出力の質は変わらないまま1.6〜1.8倍速くなると開発者は説明しています。

速度と必要なパソコンの条件

公式のベンチマークでは、RTX 5070(VRAM 12GB)とメモリ64GBの組み合わせで、最も軽い「Q2_0」が毎秒94トークンで文章を書きます。トークンとは、AIが文章を扱う単位のことです。

長い文章を読み込む速さは、毎秒2,650トークンです。推奨される「IQ2_XS」では、書く速さが毎秒79、読む速さが毎秒2,090トークンになります。

AMDのRX 9070 XT(VRAM 16GB)でも、Q2_0で毎秒60トークンが出ています。RTX 3090(VRAM 24GB)では、開発者の見積もりで毎秒100〜140トークンに達します。

必要な環境は次のとおりです。

  • GPU: VRAM 12GB以上のGeForce RTX 20〜50シリーズ(AMDは一部が実験的対応)
  • メインメモリ: 最低32GB、全モデルを動かすなら64GB
  • SSD: 空き約80GB(モデルのダウンロードだけで約70GB)
  • OS: Windows 10/11またはLinux

モデルの大きさは、Q2_0が37.6GB、IQ2_XSが39.2GB、IQ3_XXSが47GB、IQ3_Sが54.8GBです。数字が大きいほど精度は上がりますが、速度は下がります。IQ3_Sでは毎秒53トークンです。

導入はかんたんで、WindowsならPC Watchの記事によると、ZIPを展開して「START-HERE.bat」をダブルクリックするだけです。Python環境とモデルのダウンロードまで自動で進みます。

他の方法との比較

専門家をメモリに逃がして動かす発想は、Strataが初めてではありません。違いを整理しておきます。

まずllama.cppです。こちらも解説ガイドにあるとおり、--cpu-moeや--n-cpu-moeというオプションで、専門家だけをCPU側に置けます。対応するモデルが多く、手軽に試せるのが強みです。

次にKTransformersです。清華大学のグループが、国際学会SOSP ’25で論文を発表しています。CPU側の計算を高速化する専用の仕組みで、文章を書く速さは既存の方式の1.25〜4.09倍と報告されています。

Strataの特徴は、特定のモデルに絞って仕上げた点です。よく使われる専門家を学習してGPUに置き、先読みとSSDの参照表まで組み合わせています。そのかわり、動かせるモデルは限られます。

日本のユーザーにとっての意味

日本でもPC Watchが2026年10月2日に取り上げており、関心を持つ人は増えそうです。

たとえば、社外にコードを出せない会社のエンジニアを考えてみましょう。ローカルで動くコーディング用AIがあれば、機密を守ったまま使えます。Anthropic互換のAPIがあるので、既存のツールにつなぎやすいのも利点です。

個人の開発者なら、月額料金を気にせずAIに何度も試行させられます。電気代はかかりますが、利用回数の上限は気にならなくなります。

大学の研究室でも使えそうです。高価なサーバーを借りなくても、手元のゲーミングPCで大型モデルの実験ができます。

ただし、日本語の出力品質については、今回の調査では確認できていません。使う前に、自分の用途で試してください。

注意したい制約

数字は魅力的ですが、気をつけたい点もあります。

1つ目は、速度の数字が開発者の公開値だという点です。PC Watchの記事も、これらを独自に検証したわけではないと明記されています。RTX 3090や40シリーズの数字は、見積もりとされています。

2つ目は、AlphaSignalが指摘する制限です。同時に処理できるリクエストは1つだけで、出力方式は最も確率の高い単語を選ぶ方式に限られます。128Kを超える長い文章では、読み込みが遅くなります。

3つ目は、条件のきびしさです。VRAM 12GB、メモリ64GB、空き80GBは、ふつうのノートPCでは足りない水準です。AMDのGPUは、Linuxでの実験的な対応にとどまります。

よくある質問(FAQ)

Q. Strataは無料で使えますか?

A. 本体はMITライセンスで無料です。ただしモデルには別のライセンスがあるので、商用利用では条件を確認してください。

Q. 毎秒94トークンは、いつでも出ますか?

A. いいえ。RTX 5070と64GBメモリ、最も軽い量子化版を使った最良の条件の数字です。モデルを大きくしたり、文章を長くしたりすると遅くなります。

Q. メモリ32GBでも動きますか?

A. 公式では最低32GBとされています。ただし、全サイズのモデルを動かすには64GBが目安です。専門家の半分を削った「Coder」版なら、32GBに収まるとされています。

Q. 既存のAIツールと組み合わせられますか?

A. OpenAI互換とAnthropic互換のAPIがあるので、対応するコーディングツールからつなげます。

Q. 精度は落ちませんか?

A. 量子化(モデルを軽くする圧縮)をするので、小さい版ほど精度は下がり得ます。PC Watchは、IQ3_Sが公開ベンチマークでフル精度のモデルと同等だったと伝えています。

まとめ

  • Strataは、1250億パラメータのQwen3.8-Flash-NextをゲーミングPCで動かすMIT公開のソフトです
  • 専門家をGPU・メモリ・SSDに分けて置き、先読みで1.6〜1.8倍に速めます
  • RTX 5070では最大毎秒94トークンですが、開発者の公開値で、検証は限られています
  • VRAM 12GB以上、メモリ32〜64GB、SSDの空き約80GBが必要です

まずは自分のパソコンのVRAMとメモリを調べ、条件を満たすなら小さい版から試してみてください。

参考文献