ローカルLLMはどのモデルを選ぶべきか — Mac Studio のメモリ96GB・256GB・512GB別に15モデルを比べて絞り込んだ
官公庁の調査報告書を使った、オープンウェイトのモデル13本と商用の2本の比較(2026年9月時点)
発行: 株式会社Klammer/2026年10月3日
はじめに
前回の記事「コンサルティング業務におけるローカルLLMの長文読解性能 検証報告」(2026年9月24日)では、Mac Studio(96GB)で動かすモデルを Qwen3.8-27B に、256GB 級の比較相手を GLM-5.3-Flash に絞って結果を報告した。この2つは、最初から決めていたわけではない。その前段として、メモリの大きさ(96GB・256GB・512GB)ごとに動かせるモデル15本を、クラウドで同じ条件にそろえて比べ、どれがよさそうかを絞り込んでいた。前回の記事ではその結果を短く載せただけだったので、本稿では、その絞り込みの作業をモデルごとの結果とあわせて改めて報告する。
手元の機械で動く AI(ローカルLLM)は、機械のメモリの大きさで、動かせるモデルの大きさが決まる。本稿は、96GB・256GB・512GB と大きくしていくと読解の力はどれだけ変わるのか、という問いへの答えでもある。
調べたのは2026年9月中旬で、使ったモデル・価格はその時点のものである。この分野はモデルの入れ替わりが速く、半年もすれば顔ぶれが変わる。読むときは時点に注意してほしい。
結論
- 256GB 級と 512GB 級で、読解の質に差は見えなかった。256GB 級の最良(GLM-5.3-Flash)と 512GB 級の最良(GLM-5.3)は、同じ条件で3回ずつ解かせても、9回の判定がすべて同じ評価だった。
- 96GB 級は明確に落ちた。「そのまま判断材料に使える」と判定された割合は、96GB 級で26%、256GB 級で44%、512GB 級で40%だった。
- 「質のよい回答」と「資料の弱点に気づく力」は別物だった。商用の参考枠の gpt-5.6-sol は、質では 256GB 級の最良と並んだが、弱点に気づいた数は明確に多かった。
- 事実の誤りが、採点者2名の合計で30件を超えるモデルがあった(96GB 級の2本)。
- 「4bit なら何GB」という机上の計算は、実際に配られているファイルより小さく出る(最も小さい実在ファイルと比べても8〜39%・当社計算)。帯の判定は、実在するファイルの大きさで行う必要がある。
調べ方
前提: なぜ 96GB・256GB・512GB か
本稿のメモリの区分(96GB・256GB・512GB)は、当社が使う Mac Studio で選べるメモリの構成に合わせている。Mac Studio はメインメモリを GPU と共有する設計(ユニファイドメモリ)で、メモリが大きいほど大きいモデルを載せられる。当社が NVIDIA の GPU を積んだ PC ではなく Mac Studio を選んだ理由は、前回の記事の「なぜ Mac Studio か」に書いた。
NVIDIA の GPU を積んだ PC で動かす場合は、モデルが GPU のメモリ(一般向け最上位の RTX 5090 で 32GB・NVIDIA 公式・2026年9月9日確認)に収まるかが基準になり、本稿の区分とは考え方が異なる。ただし、本稿の各モデルの成績はクラウドで同じ条件にそろえて測ったもので、機械の種類には左右されない。区分は「その大きさのモデルが手元に載るか」の目安として読んでほしい。
資料と設問(前回の記事と同じ)
資料と設問は、前回の記事と同じものを使った(前回の記事の「2. 検証の設計」)。
資料: 官公庁の調査報告書2本(いずれも約15万字)
- 資料A: 製品評価技術基盤機構(NITE)「令和7年度 電気保安のスマート化推進に関する業界別推進状況の調査・分析業務 報告書」の第1〜2章
- 資料B: 厚生労働省「令和7年度 テレワークの労務管理等に関する総合実態調査 報告書」の p.1〜114
設問: 3つ × 資料2本 = 6問
- 論点の構造化: 「この資料を読み、意思決定に必要な論点を構造化してください。論点は階層で示し、それぞれ資料のどこを根拠にしているかを併記してください。」
- 欠けている情報: 「この資料だけでは意思決定できない点を挙げてください。『何が書かれていないか』と『それが無いとどの判断が下せないか』を対で示してください。」
- 反対仮説: 「この資料が暗黙に置いている前提を特定し、その前提が崩れる場合の反対仮説を立ててください。各仮説について、成否を確かめるために取るべき事実を1つ挙げてください。」
いずれの設問にも「回答は日本語で3,000字程度に収めてください。網羅せず、重要なものに絞ってください。」を付け、設問の後に資料の全文を続けて渡した。
モデルの選び方と「帯」
- 帯(96GB・256GB・512GB)は、4bit に圧縮して配られている実在のファイルの大きさで決めた(Hugging Face で2026年9月15日に確認。Gemma-4-31B と Qwen3.5-9B は実在ファイルを確認しておらず、gpt-oss-120b は公式に配られている MXFP4 形式の大きさを使った・2026年9月14日確認)。資料を読むには、本体のほかに作業用のメモリも要るので、それも見込んで帯を決めた。
- 資料を読み切れないモデル(扱える長さが131,072トークン未満)は外した。
- 実行はすべて OpenRouter 経由のクラウドで行い、fp8(8bit)での提供を指定した。温度0、出力の上限は16,000トークン。商用の2本(gpt-5.6-sol・Gemini 3.1 Pro)は量子化を指定せずに実行したので、条件が違う「参考」として扱う。
| 帯 | モデル | 4bit の実在ファイル | 価格(入力/出力・100万トークンあたり) |
|---|---|---|---|
| 512GB | GLM-5.3(z-ai/glm-5.3) | 418.6GB | $1.40/$4.40 |
| 512GB | GLM-5.2(z-ai/glm-5.2) | 418.3GB | $1.40/$4.40 |
| 512GB | Nemotron-3-Ultra(nvidia/nemotron-3-ultra-550b-a55b) | 347.0GB | $0.60/$2.40 |
| 512GB | DeepSeek-V4.1-Flash(deepseek/deepseek-v4.1-flash) | 325.4GB(別のビルドは552.9GB で 512GB を超えるため、帯の判定の確度は中) | $0.30/$1.20 |
| 256GB | GLM-5.3-Flash(z-ai/glm-5.3-flash) | 177.5GB | $0.15/$0.50 |
| 256GB | Qwen3.5-397B(qwen/qwen3.5-397b-a17b) | 223.9GB | $0.55/$3.50 |
| 256GB | DeepSeek-V4-Flash(deepseek/deepseek-v4-flash-0731) | 108.2〜177.3GB(ビルドで異なる) | $0.05/$0.10 |
| 96GB | Qwen3.8-27B(qwen/qwen3.8-27b) | 16.1GB | $0.214/$2.55 |
| 96GB | GLM-4.5-Air(z-ai/glm-4.5-air) | 60.1GB | $0.13/$0.85 |
| 96GB | Gemma-4-31B(google/gemma-4-31b-it) | (未確認) | $0.09/$0.34 |
| 96GB | gpt-oss-120b(openai/gpt-oss-120b) | 60.8GB(MXFP4 の配布ファイル) | $0.037/$0.17 |
| 96GB | Nemotron-3-Super(nvidia/nemotron-3-super-120b-a12b) | 68.0GB | $0.08/$0.45 |
| 小型 | Qwen3.5-9B(qwen/qwen3.5-9b) | (未確認) | $0.10/$0.15 |
| 商用(参考) | gpt-5.6-sol(openai/gpt-5.6-sol) | — | $2.00/$10.00 |
| 商用(参考) | Gemini 3.1 Pro(google/gemini-3.1-pro-preview) | — | $2.00/$12.00 |
価格・扱える長さは OpenRouter の2026年9月15日時点の値である。
採点
- 採点者は AI 2名(Claude Fable と GPT-6 Astra)で、それぞれ独立に採点した。どのモデルの回答かは伏せた。
- 採点項目は3つ。品質(3=そのまま判断材料に使える/2=手を入れれば使える/1=使えない)、事実の誤り(原典と矛盾する記述の数)、弱点への到達(あらかじめ作った弱点リストのうち、回答が触れた数)。
- 弱点リストは、調査の読み方の16項目を各資料に当てはめて、回答を見る前に作った(資料A 10個・資料B 8個)。当社が Claude を使って当てはめ、人が原典と照合して確定した。例えば資料Aでは「目標は導入率なのに、達成の判定は評点の平均で行っている」、資料Bでは「回収率 39.9%(6割が未回答)なのに、未回答による偏りへの言及が無い」など。
- 何を見るかと弱点リストは、回答を作る前に書面で決めた。品質3段階の意味づけだけは、回答を作った後・採点の前に補足した。
回答は全部で87本になった(資料A 42本・資料B 45本)。
検証の設計の詳細(資料の出典・弱点リストの作り方・採点の手順)は、前回の記事の「2. 検証の設計」にまとめている。
結果1: 帯ごとの比較
| 帯 | 「そのまま使える」の割合 | 判定の数 |
|---|---|---|
| 512GB(4本) | 40%(19/48) | 48 |
| 256GB(3本) | 44%(16/36) | 36 |
| 96GB(5本。gpt-oss-120b は集計に入らず、GLM-4.5-Air は資料Aのみ) | 26%(11/42) | 42 |
| 小型(1本) | 0%(0/12) | 12 |
採点者2名の判定を両方数えた割合。商用の2本と、条件を変えて実行した分(下の「条件の違うもの」)は帯の集計に入れていない。
256GB と 512GB の差(44% と 40%)は、ばらつきの範囲で、差とは読まない(結果3を参照)。96GB 級は明確に低く、小型は「そのまま使える」が0件だった。
結果2: モデルごとの成績
| モデル | 帯 | 「そのまま使える」 | 弱点への到達(設問2) | 事実の誤り(Fable/Astra) |
|---|---|---|---|---|
| GLM-5.3 | 512GB | 92%(11/12) | 8 | 0/6 |
| GLM-5.3-Flash | 256GB | 83%(10/12) | 8 | 1/4 |
| gpt-5.6-sol | 商用(参考) | 83%(10/12) | 14 | 0/2 |
| Gemini 3.1 Pro | 商用(参考) | 67%(8/12) | 2 | 2/2 |
| Qwen3.8-27B | 96GB | 58%(7/12) | 6 | 1/5 |
| Qwen3.5-397B | 256GB | 42%(5/12) | 3 | 0/4 |
| GLM-5.2 | 512GB | 42%(5/12) | 4 | 1/1 |
| Gemma-4-31B | 96GB | 33%(4/12) | 2 | 0/2 |
| DeepSeek-V4.1-Flash | 512GB | 25%(3/12) | 4 | 0/7 |
| DeepSeek-V4-Flash | 256GB | 8%(1/12) | 4 | 5/11 |
| Nemotron-3-Ultra | 512GB | 0%(0/12) | 3 | 2/7 |
| Nemotron-3-Super | 96GB | 0%(0/12) | 0 | 12/22 |
| GLM-4.5-Air | 96GB | 0%(0/12) | 0 | 11/20 |
| gpt-oss-120b | 96GB | 0%(0/6・資料Bのみ) | 0 | 5/5 |
| Qwen3.5-9B | 小型 | 0%(0/12) | 1 | 5/8 |
- 「そのまま使える」は、6問×採点者2名の12判定のうちの数。
- 弱点への到達は、設問2(この資料だけでは判断できない点)で、2名のどちらかが「触れている」と判定した弱点の数を、資料2本で足したもの(最大18)。設問2が弱点を探す問いに最も近いので、ここを主に見た。
- 1〜2判定の差は、ばらつきの範囲として読まない(結果3を参照)。
条件の違うもの
- gpt-oss-120b: 資料Aは、出力の上限16,000を確保すると扱える長さ(131,072トークン)を1,698トークン超えるため、実行できなかった。資料Bだけを、出力の上限14,000で実行した。
- GLM-4.5-Air: 資料Bは、出力の上限14,000で実行した(資料Aは共通の条件)。
- 商用の2本: 量子化を指定せずに実行した。
結果3: 同じ条件で3回解かせると、どれだけ揺れるか
順位の差が本当の差なのか、ただの揺れなのかを確かめるため、3本のモデルに資料Aの3問を3回ずつ解かせ、採点者1名(Claude Fable)が品質だけを採点した(2026年9月16日・温度0のまま)。
| モデル | 設問1 | 設問2 | 設問3 |
|---|---|---|---|
| GLM-5.3-Flash(256GB) | 3/3/3 | 3/3/3 | 3/3/3 |
| GLM-5.3(512GB) | 3/3/3 | 3/3/3 | 3/3/3 |
| Qwen3.8-27B(96GB) | 2/2/2 | 2/2/2 | 2/2/3 |
- GLM-5.3 と GLM-5.3-Flash は、9回の判定がすべて「3」で一致した。結果2の92%と83%の差は実力の差ではなく、6問で測ったときのばらつきと読む。
- Qwen3.8-27B は、設問3で1段階揺れた。温度0でも揺れるのは、提供側の切り替えなどで計算が毎回まったく同じにはならないためと考えられる。
- このため、モデル同士の1〜2判定の差は「区別がつかない」として扱う。帯ごとの集計(36〜48判定)は、1判定の揺れでは動かないので読んでよい。
分かったこと
256GB と 512GB の差は見えなかった
512GB 級の最良(GLM-5.3)と 256GB 級の最良(GLM-5.3-Flash)は、3回測っても区別がつかなかった。4bit の実在ファイルは GLM-5.3 が418.6GB、GLM-5.3-Flash が177.5GB で、同じ読解の質を半分以下(約0.42倍・当社計算)の大きさで得られたことになる。当社は、これより前の予備的な比較で、512GB の機械を選ぶ根拠は無いと判断していたが、条件をそろえたこの比較でも同じ結論になった。
「質」と「弱点に気づく力」は別物
| モデル | 「そのまま使える」 | 設問2で気づいた弱点(資料A/資料B) |
|---|---|---|
| gpt-5.6-sol | 83% | 6/10・8/8 |
| GLM-5.3 | 92% | 4/10・4/8 |
| GLM-5.3-Flash | 83% | 3/10・5/8 |
| Gemini 3.1 Pro | 67% | 2(2本の合計) |
質では gpt-5.6-sol と 256GB・512GB 級の最良が並んだが、弱点に気づいた数は gpt-5.6-sol が明確に多かった。資料Bでは、用意した8つの弱点すべてに触れたのは gpt-5.6-sol だけだった。一方、同じ商用でも Gemini 3.1 Pro は2つにとどまり、「商用なら強い」とは言えない。
読みやすく整った回答を書く力と、「この数字は主張の根拠になっていない」と気づく力は、別の能力だと考えたほうがよい。
事実の誤りは、質とは別に数える
96GB 級の Nemotron-3-Super と GLM-4.5-Air は、事実の誤りが2名合計で30件を超えた(Fable 12・Astra 22、Fable 11・Astra 20。GLM-4.5-Air の資料Bは出力の上限を変えた実行)。品質の判定だけを見ると見落とす。業務で使うなら、品質の点よりこちらの方が致命的になりうる。
「読まずに型を当てはめる」モデルはほぼいなかった
資料Bは調査設計が丁寧な報告書で、資料Aにあった弱点(回収率が書かれていない、無回答を0点で平均に入れている、など)は資料Bには無い。そこで、資料Bに無い弱点を指摘したら「空振り」と数える仕掛けを入れた。空振りの判定の対象になる資料Bの回答45本のうち、空振りは1件(DeepSeek-V4-Flash が「配布数・回収率が書かれていない」と指摘)だけだった。事前の想定より、ずっと少なかった。
4bit の大きさは、机上の計算より大きい
公式に配られているファイルの大きさを4bit 相当に割り戻した机上の計算と、実在する4bit のファイルを比べると、最も小さい実在ファイルでも8〜39%大きく、ビルドによっては2倍以上になった(当社計算)。たとえば DeepSeek-V4-Flash は、机上では約78GB で 96GB にぎりぎり載る見込みだったが、実在するファイルは108.2GB以上で、96GB には載らない。同じ「4bit」でも、作り方によって108.2GB〜177.3GB と約1.6倍(当社計算)の差があった。機械を選ぶときは、使うつもりのファイルそのものの大きさで確かめる必要がある。
モデル別の見どころ: Qwen と gpt-oss
結果2の表のうち、Qwen の3本と gpt-oss-120b について、採点者2名の記録(判定の理由・誤りの中身)と回答の本文まで戻って読み直した。ここでも、1〜2判定の差は区別がつかないものとして扱う。
Qwen: どの大きさを選ぶか
| モデル | 帯 | 4bit の実在ファイル | 「そのまま使える」 | 弱点への到達(設問2) | 事実の誤り(Fable/Astra) |
|---|---|---|---|---|---|
| Qwen3.5-9B | 小型 | (未確認) | 0%(0/12) | 1 | 5/8 |
| Qwen3.8-27B | 96GB | 16.1GB | 58%(7/12) | 6 | 1/5 |
| Qwen3.5-397B | 256GB | 223.9GB | 42%(5/12) | 3 | 0/4 |
- 同じ 3.5 の版どうしでは、大きい方がはっきり上だった。「そのまま使える」は 9B が0判定、397B が5判定。事実の誤りも 397B の方が少なかった。
- 版の違う 27B(3.8)と 397B(3.5)は、区別がつかない。「そのまま使える」の差は2判定で、ばらつきの範囲である。ファイルの大きさは約14倍(当社計算)違うが、大きい方が上回ったわけではない。弱点への到達も、397B の方が多くはなかった(27B が6、397B が3)。
- 27B の58%は、高めに出ている可能性がある。本番では、資料Aの3問すべてに Fable が「3」を付けた。ところが結果3で同じ条件のまま3回解き直させると、9回のうち8回が「2(手を入れれば使える)」だった。回答の揺れか採点の揺れかは切り分けていないが、58%と42%から「27B の方が上」とは読まない。
- 256GB の機械なら、397B より GLM-5.3-Flash。同じ帯の GLM-5.3-Flash は「そのまま使える」が10判定(397B は5判定)で、ファイルも小さい(177.5GB と 223.9GB)。397B は 256GB の機械に載るものの、作業用のメモリの余裕は小さい。
- 96GB 級で「そのまま使える」が最も多かったのは Qwen3.8-27B(7判定。次は Gemma-4-31B の4判定)で、当社が 96GB の機械で使うことにしたのもこのモデルである。ただし、手元で 4bit で動かすと弱点への到達が下がった(前回の記事)。
gpt-oss-120b: 条件つきだが、「使えない」が最も多かった
- 実行できたのは資料Bの3問だけ。扱える長さが131,072トークンで、約15万字の資料Aに出力の枠を足すと収まらなかった(結果2「条件の違うもの」)。長い資料を丸ごと渡す使い方では、そもそも余裕が小さい。
- 6判定のうち5つが「1(使えない)」だった。全87本・174判定のうち「1」は11判定で、そのうち5つが gpt-oss-120b だった。ほかのモデルは多くて2判定(12判定中)である。
- 同じ 96GB 級の Qwen3.8-27B と資料Bだけで比べると、「そのまま使える」は2判定と0判定でばらつきの範囲だが、「使えない」は Qwen3.8-27B の0判定に対して5判定だった。ファイルは gpt-oss-120b の方が約3.8倍大きい(60.8GB と 16.1GB・当社計算)。
- 採点者2名の記録から読める弱さは、次の2つである。
- 「重要なものに絞ってください」に従わなかった。設問1は論点ではなく調査結果の要約を並べ、設問2は20項目の表、設問3は15項目を並べた。字数は指示の範囲(空白と表の記号を除いて約2,100〜2,700字・当社計算)に収まっていたので、長さではなく選び方の問題である。
- 資料に結び付いていない。設問3の15の前提は、報告書の図表や数値に触れず、テレワーク一般の話になっていた。設問2では、報告書に載っている規模別・業種別の集計を「書かれていない」と挙げ、2名とも事実の誤りに数えた。
- 事実の誤り(5/5)は、資料Bだけで見ても Nemotron-3-Super(8/11)より少ない。弱さの中心は、誤りの数より、資料を読んで絞り込めていない点にある。
- 注意: 推論の深さは、ほかのモデルと同じく指定せず、提供側の既定のまま動かした。回答の前の推論は1問あたり236〜376トークンで、同じ条件(資料B・出力の上限14,000)で動かした GLM-4.5-Air(851〜1,362トークン)より短かった。推論を深くしたときの成績は測っていない。
この条件で測った限り、長い資料を読んで論点を出す用途で gpt-oss-120b を選ぶ理由は見当たらなかった。
この結果の使い方と注意
- 本稿の数字はクラウドで fp8 にそろえて測ったもので、手元の機械の条件(4bit に圧縮)とは違う。前回の記事では、96GB の機械で同じモデル(Qwen3.8-27B)を手元で動かすと、弱点への到達が下がったことを報告している。256GB 級のモデルを手元で動かしたときの成績は未測定で、2027年1月に実機で測る予定である。
- 採点者は AI である。2名の品質の判定は87本中19本で割れ、Fable が高く付けたものが11本、Astra が高く付けたものが8本だった。「そのまま使える」を付けた数は Fable 36本・Astra 28本で、Fable の方が付けやすかった。
- 弱点リストの作成にも AI(Claude)を使っている(人が原典と照合して確定)。
- 規模が小さい(資料2本・6問)。モデル同士の1〜2判定の差は読まない。
- 長い資料を読む作業だけを測った。コードを書く、議事録をまとめる、などは測っていない。
- 生成の費用は、87本で約6米ドルだった(採点の費用は別)。
全回答(87本)は、採点記録と一緒に付属資料「ローカルLLM検証の生回答」で読める(「クラウド」で絞り込む)。
出典・記録
- 前回の記事: 株式会社Klammer「コンサルティング業務におけるローカルLLMの長文読解性能 検証報告」2026-09-24 https://klammer.co.jp/blog/local-llm-reading-report-01/
- 全回答と採点記録: https://klammer.co.jp/wp-content/themes/swell_child/reports/local-llm-reading/raw-answers-01.html
- 資料A: 製品評価技術基盤機構(NITE)「令和7年度 電気保安のスマート化推進に関する業界別推進状況の調査・分析業務 報告書」令和8年2月 https://www.nite.go.jp/data/000160723.pdf
- 資料B: 厚生労働省「令和7年度 テレワークの労務管理等に関する総合実態調査 報告書」令和8年3月 https://www.mhlw.go.jp/content/11911500/001683114.pdf
- モデルの価格・扱える長さ: OpenRouter のモデル一覧(2026年9月15日取得)
- 4bit の実在ファイルの大きさ: Hugging Face の各リポジトリ(2026年9月15日取得)
