コンテンツにスキップ

モデルカタログと仕様

対象
モデルを選ぶ人、何が動くか確認したい人
必要なもの
何も要りません
所要時間
自分のハードウェアの行を引く

Waired は、ノートパソコンからマルチ GPU サーバーまでをカバーするモデルカタログを バンドルしています。初回起動時には、自分のハードウェアに合うモデルを自動選択します。 いつでも切り替え可能です。詳しくは 使うモデルを選ぶ を参照してください。

カタログは 2 つの軸で分割してあり、自分のマシンに該当する行へすぐ辿り着けます:

  1. ランタイム別 — Ollama か vLLM か。 OS と GPU によってどちらのエンジンがモデルを 実行するかが決まるため、ランタイムごとに節を分けています。自分の節だけを読んでください:

    • Ollama — macOS (Metal)、Windows、Linux、CPU、低 VRAM / 統合 GPU。GGUF(量子化) ビルドを実行し、見るべき数値は システム RAM です。
    • vLLM — Linux 上の NVIDIA (CUDA) / AMD (ROCm) の単体 GPU サーバー。safetensors (awq/fp8/mxfp4)ビルドを実行し、見るべき数値は GPU VRAM です。

    両エンジン向けにビルドを持つファミリーは、両方の節に掲載されます。

  2. アーキテクチャ別 — Dense か MoE か。 各ランタイムの中では Dense を先に、続いて Mixture-of-Experts(MoE)を並べています:

    • Dense — すべてのパラメータが毎トークン計算されます。計算力 / VRAM に余裕が ある環境(単体 GPU)向きで、同じ品質ならディスク占有は小さめです。
    • MoE — 総サイズは巨大ですが、トークンあたりにアクティブなのは数十億パラメータ だけなのでデコードは高速です。大きなモデルをメモリに載せられる大容量の ユニファイドメモリを積んだマシン(Apple Silicon、AMD Strix Halo)に最適です。

サイズ は、そのモデルがどのクラスのGPUで動くかを表します。

  • small — 8 GB のカードで動く
  • medium — 32 GB のカードで動く
  • large — 32 GB を超えるカードが要る

どのパソコンで読んでも同じ意味になるため、外部で引用できるのはこの値です。 隣のメモリ列は閾値であり、自分のマシンで収まるかどうかの判定は waired models ls --detail が答えます(システムメモリとグラフィックメモリを 合算して判定します)。

Waired は自分のマシンに収まり、かつ大きなコーディングコンテキスト(~20万トークン)を 保持できる中で最も強いモデルを実行します — コーディングエージェントは日常的に 10 万トークン超のコンテキストを使うため、それを切り詰めてしまうモデルより、 コンテキストウィンドウ全体を確保できる少し小さなモデルが優先されます。そのコンテキスト長を どのモデルも確保できないハードウェアでは、最良の適合を選んだうえで waired status に その旨を表示します。選ばれたモデルはクライアントから固定のモデル名 waired/default で 指定できます(チャットクライアント を参照)。

下の各表は、各モデルのバンドルマニフェスト(min_ram_gb / min_vram_mb / estimated_weight_gb / param_count / active_params)からビルド時に生成されるため、 クライアントが同梱するカタログと常に一致します。

Mac、Windows、CPU、低 VRAM / 統合 GPU 向け。メモリ列は GGUF(q4)ビルドに必要な最小 システム RAM で、メモリが小さいマシン向けのものから順に並びます。

すべてのパラメータが毎トークン計算されます。RAM、次いで品質で選びます。

モデルパラメータサイズOllama RAM
qwen3.5-0.8b800Msmall2 GB
qwen3.5-2b2Bsmall4 GB
qwen3.5-4b4Bsmall8 GB
qwen3.5-9b9Bsmall12 GB
qwen3.5-27b27Bmedium24 GB
qwen3.6-27b27Bmedium24 GB
qwen3.8-27b27Bmedium24 GB

ディスク上は大きくてもデコードは高速。大容量のユニファイドメモリを積んだマシン (Apple Silicon、Strix Halo)に最適です。

モデルパラメータ(アクティブ)サイズOllama RAM
gpt-oss-20b20.9B (3.6B active)medium16 GB
qwen3.5-35b-a3b35B (3.3B active)medium32 GB
qwen3.6-35b-a3b35B (3.3B active)medium32 GB
gpt-oss-120b117B (5.1B active)large96 GB
qwen3.5-122b-a10b122B (10B active)large128 GB

Linux 上の NVIDIA (CUDA) / AMD (ROCm) の単体 GPU サーバー向け。メモリ列は量子化 (awq/fp8/mxfp4)ビルドに必要な最小 GPU VRAM で、VRAM が小さい GPU 向けのものから 順に並びます。同一 NVIDIA GPU を複数積んだホストでは vLLM がモデルを分割して 載せる(テンソル並列)ため、合算 VRAM が要件にカウントされます。比較的新しい NVIDIA GPU(Ada / Hopper 以降 — 例: L4、RTX 40 系)では KV キャッシュを fp8 で 保持し、ほぼ同等の品質のまま同じ VRAM で収まるコンテキストウィンドウが約 2 倍になります。 それでもモデルのフルコンテキストウィンドウが GPU メモリに収まらない場合は、起動 失敗ではなく縮小したウィンドウで実行され、waired status / waired doctor に その旨が表示されます。

計算性能がボトルネック。VRAM に余裕のある単体 GPU を持っている場合の自然な選択です。

モデルパラメータサイズvLLM VRAM
qwen3.6-27b27Bmedium38 GB
qwen3.8-27b27Bmedium38 GB

総サイズは巨大でもアクティブパラメータの割合は小さく、マルチ GPU サーバーと好相性です。

モデルパラメータ(アクティブ)サイズvLLM VRAM
gpt-oss-20b20.9B (3.6B active)medium20 GB
gpt-oss-120b117B (5.1B active)large79 GB
deepseek-v4-flash284B (13B active)large192 GB
glm-5.2744B (40B active)large547 GB

提示されるモデルと、Waired が選ぶモデル

Section titled “提示されるモデルと、Waired が選ぶモデル”

この 2 つは別の問いであり、Waired はそれぞれ別に答えます。

モデルは、そのパソコンのメモリに収まる限り提示されます。収まるかどうかは、 重み・推論エンジンのKV キャッシュ・コーディング 1 セッション分の KV キャッシュの合計で判定します。システム RAM とグラフィックス メモリは合算します。カードに載りきらない分をエンジンがシステム RAM に置いて 実行するためです。

この合計が、waired models ls --detail と Waired アプリの Models 一覧の NEEDS 列に出る値です。本当に収まらないモデルは必要な容量を添えて表示され、 選択もできます — 選ぶとまず確認を求められます。

合算しない機種は Apple Silicon だけです。「VRAM」が同じ RAM の 一部を指すため、RAM の総量がそのまま上限になります。

選択: このパソコンでコーディング 1 セッション分を保持できるか

Section titled “選択: このパソコンでコーディング 1 セッション分を保持できるか”

収まるモデルのうち、重みをGPUに載せたまま 約 200,000 トークンのコーディングセッションを実行できる、最も強いものを Waired は推奨します。

収まるが上記を満たさないモデルも、引き続き提示され選択できます。Waired が 自動で選ばないだけです。該当するのは主に次の 2 つです。

  • 重みがGPUに収まらない。 応答の 1 語ごとに システム RAM から読み直すことになり、長いコーディング用プロンプトほど 代償が大きくなります。解消するには容量の大きいカードが必要です。
  • 本体は載るが、KV キャッシュが同居できない。 動作も応答品質も 問題ありませんが、長いセッションを保持できないため、コーディング エージェントの接続先としては選ばれません。

選ぶ場所では、どれがどれなのかが分かるようになっています。Waired が このパソコンに対して選ぶモデルには recommended の印が付き、動きはするが そうではないモデルには理由付きの印が付きます。印が付いていても選択は可能です。

recommended が付くモデルでも、セッションのKV キャッシュの一部が システム RAM に残ることがあります。本体はカードに収まるが、その隣に キャッシュまでは収まらない、という状態です。該当する場合は waired models ls --detail とダウンロードの確認が、ダウンロードを 始める前にその量を伝えます:

qwen3.5-9b ... ✓ fits · recommended · 2.5 GB of KV cache in system RAM

モデルは動きます。その部分をシステムメモリから読むぶん、カードから読むより 遅くなります。どれだけ遅くなるかはマシン次第なので、Waired は速度を推測せず メモリの量を伝えます。実際の速度は導入後のベンチマークが実測し、遅すぎる 場合はより軽いモデルを提案します。

この列には、もう 1 つ値が出ることがあります。出るのは、エンジンがいま 実際に動かしているモデルの行だけです:

qwen3.8-27b ... ! running here with a warning

これは上のトレードとは別のものです — KV キャッシュをシステム RAM に残した モデルは、予測どおりに動いていることがあります。この値は、モデルは動いて いるが、行の残りが予測する構成をこのパソコンが保持できなかったことを 意味します。エンジンが記録した内容は表の下に 1 回だけ表示され、 waired status が同じ内容を繰り返し、waired doctor が対処を伝えます。

メモリに収まることと、速く動くことは別です。共有メモリの Mac では、大きな Dense モデルは収まっても毎秒数語しか返せないことがある一方、同程度のサイズの MoE モデルは何倍も高速に応答します。Waired は各モデルの横にこの推定値を表示し、 最初のモデルを導入したあとは実機の速度を実測して、より軽いモデルの方が 適している場合に知らせます。速度を理由にモデルが提示されなくなることは ありません。速度が決めるのは Waired が薦めるモデルであって、選べる モデルの範囲ではありません。

どのモデルを選んでも、コーディング用途としては実用にならないパソコンもあります。 そうしたパソコンでは、小さいモデルを選んでも解決しません。グラフィックス カードのないパソコンは、1 リクエストに数分かかることがあり、 カタログ最小のモデルでも、載せられる最大のモデルとほとんど同じだけかかります。 これはモデルではなくパソコン側の話です。

そのため Waired は実際に試して確かめます。推論エンジンを導入した直後——数十 GB のフルサイズのモデルを何かがダウンロードするより前——に、1 GB 程度の小さい モデルを取得し、現実的な1 リクエスト——長い質問と、それに対する 通常の長さの回答——をそのパソコンで計測します。計測は 3 回行い、中央の結果を 採用します。たまたま 1 回だけ混雑していたパソコンが、その 1 回で判断される ことはありません。全体で、速いパソコンなら数秒、遅いパソコンでも数分で 終わります。この 1 往復が 45 秒を超える見込みなら、期待外れになるものを ダウンロードするのではなく、ローカル推論をオフの状態で開始します。

これはターミナルからでもブラウザからでも、すべてのセットアップ経路で行われます。 モデルを選ぶ前に数値が出ている状態になります。計測はインストールごとに 1 回です。 サービスを再起動しただけなら前回の結果を再利用し、Waired または推論エンジンを 更新した場合は計測し直します。新しいビルドでの速度は、そのパソコンについての 新しい事実だからです。

計測結果はその後 waired inference status で確認でき、ローカル推論がオフに なっている理由がこの計測であれば、その旨も表示されます。

ローカル推論がオフで始まる理由は速度だけです。以前はこれに加えて、載せられる 最良のモデルがコーディング作業に使える品質に届かないとみなした場合も拒否して いました。収まるモデルがあるのに何も与えられない状態になるため、現在はやめて います。載せられるモデルを実行し、それが何かを表示します。

これは出発点であって、判定ではありません。

  • そのパソコンはネットワークには参加し、他のパソコンで動いている AI を 利用できます。
  • ローカル推論はいつでも有効にできます。ターミナルなら waired inference on、 Waired アプリなら このコンピュータでモデルを実行。有効にした時点で、 エンジンと、そのパソコンに収まる小さいモデルを Waired が導入します。 計測に使った小さいモデルは、すでにそのパソコン上にあります。
  • 一度その選択をしたら、Waired はそれを保持します。計測は出発点を決めるために 行うものであり、選択を覆すために再実行されることはありません。

詳しくは トラブルシューティング → 非常に小さいモデルが選ばれた を参照してください。

自動では選ばれないモデルもある

Section titled “自動では選ばれないモデルもある”

ここまではすべてこのパソコンについての話です。最後に 1 つ、そうでないものが あります。

一部のモデルは、名指しで探しに来る人がいるから収録されていますが、 求めていない人に Waired が選んで出すことはありません。どのマシンでも同じで、 モデルの出来に対する評価ではありません。Waired が推奨するのは、同程度の サイズの他のモデルではなくそのモデルである理由を言えるときだけで、 これらについてはそれが言えないためです。

現時点では OpenAI の gpt-oss 20Bgpt-oss 120B が該当します。

Qwen3.6 27B も自動では選ばれませんが、理由は別です。Qwen3.8 27B が同じ 系列の次の世代にあたるため、Qwen3.6 27B が答えていた問いには、より新しい答えが できたからです。カタログに残してあるのは、すでにダウンロード済みのパソコンが 何かをダウンロードし直さずにそのまま使い続けられるようにするため、そして名前を 指定して選ぶ操作がこれまでどおり動くようにするためです。

3 つとも一覧には並び、どれも選択でき、その先の動作は他のモデルと完全に同じです (ダウンロードも実行も、表示のされ方も変わりません)。行われないのは、 導入時に Waired がこれらを選ぶこと、recommended の印を付けること、 モデル変更を提案するときに名前を挙げることの 3 つです。

ハードウェアの追加でモデルを失うことはない

Section titled “ハードウェアの追加でモデルを失うことはない”

GPUの追加や増設は、このパソコンに提示されるモデルと推奨される モデルを良くする方向にしか働きません。小容量のカードでも同じです。エンジンの 背後にはシステム RAM 全量が残るため、カードを積んだマシンが、同じマシンから カードを外した状態より短いセッションや下位のモデルを与えられることはありません。

NVIDIA のGPUを複数搭載したマシンでは、Waired はそれらを まとめて数えます。1 枚には収まらないモデルでも、2 枚にまたがって収まるなら 候補として扱われます。メーカーの異なるカード同士はまとめられません。エンジンが 1 つのモデルをそれらにまたがって展開できないためです。

Windows と macOS では Ollama で動作します。vLLM での推論には Linux が必要な ため、これらのマシンでは大容量の NVIDIA カードを積んでいても Ollama 向けの 一覧から選ばれます。

vLLM 向けの一覧にカードへ収まるモデルが 1 つもない場合も、Ollama 向けの 一覧から選ばれます。vLLM 向けのビルドは Ollama 向けより大きいサイズから 始まるため、vLLM のしきい値を超えたカードでも、その一覧のどのモデルにも 届かないことがあります。この場合 Waired は「スペック不足」とは扱わず、 カードで実際に動くモデルを提供します。

これは Waired が自動で選ぶ対象にのみ影響します。メモリに収まるモデルは 引き続き自分で選択できます — 使うモデルを選ぶ を参照してください。

何も変更せずにルーティングの判断をプレビューするには:

Terminal window
waired infer --explain "say hi"

waired models ls --detail を実行すると 自分の ハードウェアに対する同じ内容 — 各モデルのサイズ、GPU上で必要になるメモリ、収まるかどうか、そして Waired ならどれを選ぶか — を確認できます。waired models ls ではディスク使用量を、 waired runtimes status ではロード済みモデルが実際に使用している VRAM を確認できます。

統合 GPU(Strix Halo、Intel)を使用していてモデルが Ollama でロードできない場合は、 トラブルシューティング → 統合 GPU を参照してください。

カタログはリリースごとに変わります。モデルを取り下げる際、Waired はその名前を そのまま使えるようにしたうえで後継モデルへ向けます。設定ファイル・スクリプト・ コーディングエージェントの設定に保存した名前は、エラーにならず引き続き応答します。

その場合は次の行が表示されます:

"qwen2.5-coder-0.5b" was retired; using "qwen3.5-0.8b" instead

リクエスト・ダウンロード・モデル切り替えのいずれも後継モデルに従います。 マシン上のデータは削除しません。ダウンロード済みのモデルはそのまま残り、 自分で切り替えるまで動作し続けます。

例外は、退役したモデルを新たに設定として選ぶ場合です。ここだけは後継への 自動変更を行わず、Waired が後継モデル名を示して受け付けを断ります。選んでいない モデルが後から動いていたという事態を避けるためです。

これまでに退役したモデル:

退役 代わりに使うモデル 理由
qwen2.5-coder-0.5b-instruct qwen3.5-0.8b コーディングエージェントが依存するツール呼び出しを安定して行えなかったため。
qwen2.5-coder-3b-instruct qwen3.5-2b 1 つ前の世代。後継のほうが小さく、より安定して応答します。
qwen2.5-coder-7b-instruct qwen3.5-4b 1 つ前の世代。会話を 32,000 トークンまでしか保持できず、コーディング作業には短すぎました。
qwen2.5-coder-14b-instruct qwen3.5-9b 7B と同じ 32,000 トークンの制限。
qwen3-coder-30b-a3b-instruct qwen3.6-27b 同種のモデルの 1 つ前の世代。
qwen3-coder-next-80b-a3b-instruct qwen3.6-35b-a3b 1 つ前の世代。後継のほうが小さく、成績も上です。
qwen3-coder-480b-a35b-instruct glm-5.2 1 つ前の世代。
glm-4.5-air-106b-a12b glm-5.2 1 つ前の世代で、会話を 131,000 トークンまでしか保持できませんでした。

0.5B より下の行は 1 回のリリースでまとめて退役しました。Waired は同時に 1 世代の モデルだけを載せる方針で、これらは現行世代の 1 つ前にあたります。個々のモデルへの 評価ではありません。いくつかは良いモデルでしたし、計測できたものは単純に後継に 負けただけです。