検証報告の付属資料

ローカルLLM検証の生回答

報告書「コンサルティング業務におけるローカルLLMの長文読解性能 検証報告」で使った全回答 / 株式会社Klammer / 2026年9月24日

各モデルが出した回答を、手を加えずに載せています。採点の基準と弱点リストも下に置いたので、読者が自分で採点し直せます。

採点の基準と弱点リスト

品質(主な指標)

設問何を見るか
q1意思決定に関係する論点が階層化され、資料の根拠と対応しているか
q2重要な不足・判断限界を選び、「何が書かれていないか」と「どの判断が下せないか」を具体的に対応させているか
q3前提/反対仮説/成否を確かめる事実が区別され、対応しているか

3=そのまま実務判断の材料に使える/2=手を入れれば使える(要求の一部が欠けるか、重要でないものが混ざる)/1=使えない。長い回答を高く評価しない。3段階の意味づけは、生成の後・採点の前に補足した。

弱点リスト(回答を見る前に確定)

主張と根拠が対になって現れたら「到達」。資料の記述を写しただけは未到達。

ID到達と見なす条件

資料Bのみ: 空振り(偽陽性)

資料Bに無い弱点(資料Aにだけある弱点)を指摘したら記録する。

#空振りとなる主張資料Bの実際
1配布数・回収率が書かれていない20,000社・39.9%と明記
2無回答を0点として集計に算入している「集計の対象外」と明記
3順序尺度を等間隔の点数として平均している評点化していない
4各図表の分母が不明である※で対象を明記、n<30 は原則未掲載
5達成/未達の閾値が僅差で反転する達成判定をしていない