検証報告の付属資料
報告書「コンサルティング業務におけるローカルLLMの長文読解性能 検証報告」で使った全回答 / 株式会社Klammer / 2026年9月24日
各モデルが出した回答を、手を加えずに載せています。採点の基準と弱点リストも下に置いたので、読者が自分で採点し直せます。
| 設問 | 何を見るか |
|---|---|
| q1 | 意思決定に関係する論点が階層化され、資料の根拠と対応しているか |
| q2 | 重要な不足・判断限界を選び、「何が書かれていないか」と「どの判断が下せないか」を具体的に対応させているか |
| q3 | 前提/反対仮説/成否を確かめる事実が区別され、対応しているか |
3=そのまま実務判断の材料に使える/2=手を入れれば使える(要求の一部が欠けるか、重要でないものが混ざる)/1=使えない。長い回答を高く評価しない。3段階の意味づけは、生成の後・採点の前に補足した。
主張と根拠が対になって現れたら「到達」。資料の記述を写しただけは未到達。
| ID | 到達と見なす条件 |
|---|
資料Bに無い弱点(資料Aにだけある弱点)を指摘したら記録する。
| # | 空振りとなる主張 | 資料Bの実際 |
|---|---|---|
| 1 | 配布数・回収率が書かれていない | 20,000社・39.9%と明記 |
| 2 | 無回答を0点として集計に算入している | 「集計の対象外」と明記 |
| 3 | 順序尺度を等間隔の点数として平均している | 評点化していない |
| 4 | 各図表の分母が不明である | ※で対象を明記、n<30 は原則未掲載 |
| 5 | 達成/未達の閾値が僅差で反転する | 達成判定をしていない |