コンサルティング業務におけるローカルLLMの長文読解性能 検証報告
官公庁の調査報告書を用いた Mac Studio(96GB)実機評価
発行: 株式会社Klammer/2026年9月24日
要旨
機密資料をクラウドに出さずに AI で分析したい、という需要がある。そこで、手元の機械(Mac Studio・メモリ 96GB)で動く AI が、官公庁の長い調査レポート(約100ページ)をどこまで読めるかを測った。
- 速度は実用的。10万トークン(約15万字)の読み込みが約3〜4分、生成は毎秒 約19〜25トークン
- 論点の整理などは、手直しすれば使える水準。同じモデルをクラウドで動かした場合と同程度
- ただし「資料の弱点を見抜く力」は大きく劣る。あらかじめ用意した弱点リストへの到達数は、96GB で動く最良の設定で 9。256GB 級の機械で動くモデル(クラウドで代わりに測定)は 36
- 劣る主な原因は、メモリに載せるための圧縮(量子化)。考える量を最大にしても改善せず、圧縮を弱めると 3 → 9 まで戻って頭打ちになった
- 大きいモデルも、手元では圧縮しないと載らない。クラウドでの評価は楽観側に出る可能性が高く、導入前に実機で測るべき
弱点への到達(6問 × 採点者2名の延べ)
| 同じ6問・同じ採点者2名(2026-09-24 の同一採点回) | そのまま使える率 | 事実誤り | 弱点への到達(延べ) |
|---|---|---|---|
| 96GB 実機 Qwen3.8-27B(重み 8bit・作業メモリ 16bit) | 50% | 8 | 9 |
| 96GB 実機 Qwen3.8-27B(重み 8bit・作業メモリ 8bit) | 33% | 9 | 9 |
| 96GB 実機 Qwen3.8-27B(重み 4bit・作業メモリ 16bit) | 67% | 13 | 7 |
| クラウド Qwen3.8-27B(fp8) | 33% | 9 | 13 |
| クラウド GLM-5.3-Flash(fp8。256GB 級の代わり) | 75% | 5 | 36 |
(重み 4bit・作業メモリ 8bit=Ollama の既定では、別の採点回で 25%・事実誤り 11・到達 3)
全回答(119本)と採点記録は付属資料「ローカルLLM検証の生回答」で読める。
1. 背景と問い
- コンサルティング業務では、大量の資料を読み込んで論点を整理することがままある。そしてその際には、資料が言っていないことや根拠が弱いところを指摘できること(気づけること)も重要である
- そして、コンサルティング業務で利用する顧客の資料は、現状クラウドの生成AIに入れられないことが多い。手元の機械で動く AI(ローカルLLM)で代替できるか
- 機械のメモリの大きさで、動かせるモデルの大きさが決まる。96GB で足りるのか、256GB・512GB が要るのかを、公開資料で先に確かめた
問い:
- 96GB の機械で動く AI は、長いレポートを業務で待てる速さで読めるか
- 読んだうえで、論点の整理と「弱点の指摘」がどこまでできるか
- 大きいメモリの機械で動くモデルと比べて、どれだけ差があるか
本検証は 96GB の機械で行った。256GB の機械(Mac Studio M5 Ultra)でも同じ検証を 2027年1月に実施予定。
1-2. なぜ Mac Studio か
ローカルLLMを動かす機械には、NVIDIA の GPU(RTX シリーズなど)を積んだ PC という選択肢もある。本検証で Mac Studio を選んだ理由は次のとおり。
- メモリの容量が最初の関門になる。長い資料を読ませるには、モデル本体に加えて、読んだ内容を覚えておく作業メモリが要る。これらが GPU から使えるメモリに収まらないと、実用的な速さで動かない
- Mac Studio はメインメモリを GPU と共有する設計(ユニファイドメモリ)で、96GB〜512GB の構成がある
- NVIDIA の一般向け最上位 RTX 5090 は GPU のメモリが 32GB(NVIDIA 公式・2026-09-09 確認)。今回 96GB 機で最良だった設定(重み 8bit で 29GB+作業メモリ 8GB)も、1枚には収まらない【当方計算】
- 96GB のメモリを持つ業務用の RTX PRO 6000 Blackwell は、NVIDIA 公式ストアで1枚 16,000 米ドル(2026年9月の報道: TechPowerUp)。256GB 級のモデル(4bit で 177.5GB)を載せるには2〜3枚が要る【当方計算】
- 常時稼働させる。事務所に置いて動かし続ける前提のため、消費電力・騒音・熱が小さいことを重視した
- 弱点もある: 長い資料の読み込み(prefill)は計算の速さで決まり、一般に NVIDIA の GPU の方が速い。本検証の Mac では、10万トークンの読み込みに約3〜4分かかった。1文字ずつの生成はメモリの帯域で決まり、Mac Studio(M5 Ultra)は 1,200 GB/s(Apple 発表・2026年8月)、RTX 5090 は 1,792 GB/s(NVIDIA 公式)
2. 検証の設計
2-1. 資料(公開資料のみ)
| 資料A | 資料B | |
|---|---|---|
| 名称 | 令和7年度 電気保安のスマート化推進に関する業界別推進状況の調査・分析業務 報告書 | 令和7年度 厚生労働省委託事業 テレワークの労務管理等に関する総合実態調査 報告書 |
| 発行 | 独立行政法人製品評価技術基盤機構(NITE)・令和8年2月 | 厚生労働省・令和8年3月 |
| 使った範囲 | 第1〜2章 | p.1〜114(全188ページ中) |
| 文字数 | 155,623字 | 145,964字 |
| 入力トークン(実機・Qwen) | 101,864 | 93,085 |
| sha256(テキスト化・改行LF統一後) | 7dcbd991…dfcc47d | 00319426…728d278 |
| 出典 | https://www.nite.go.jp/data/000160723.pdf(掲載ページ https://www.nite.go.jp/gcet/tso/smart_hoan_questionnairesurvey_r7.html・2026-09-24 確認) | https://www.mhlw.go.jp/content/11911500/001683114.pdf |
どちらもアンケート結果を大量に集計し、考察と提言を述べる報告書。資料Bは調査設計が丁寧で(回収率や分母を明記)、資料Aとは弱点の型が違うものを選んだ。
2-2. 設問(3問 × 資料2本 = 6問)
- q1 論点の構造化: 「この資料を読み、意思決定に必要な論点を構造化してください。論点は階層で示し、それぞれ資料のどこを根拠にしているかを併記してください。」
- q2 欠けている情報: 「この資料だけでは意思決定できない点を挙げてください。『何が書かれていないか』と『それが無いとどの判断が下せないか』を対で示してください。」
- q3 反対仮説: 「この資料が暗黙に置いている前提を特定し、その前提が崩れる場合の反対仮説を立ててください。各仮説について、成否を確かめるために取るべき事実を1つ挙げてください。」
いずれも「回答は日本語で3,000字程度に収めてください。網羅せず、重要なものに絞ってください。」を付けた。設問の後に資料の全文を続けて渡した。
2-3. 「弱点リスト」を先に作った
AI に解かせる前に、調査の読み方の16項目(母集団と標本数、回収率、無回答の扱い、年次比較の同一性、目標と実測の定義 など)を各資料に当てはめ、弱点リストを確定した(資料A 10個、資料B 8個)。例:
- 資料A: 目標は「導入率」なのに、達成の判定は「評点の平均」で行っている/配布数が無く回収率が計算できない/無回答を0点として平均に入れている/需要設備は約92万件に対し回答13件
- 資料B: 回収率 39.9%(6割が未回答)なのに、未回答による偏りへの言及が無い/経年比較で選択肢や補正の基準が変わっている/「実際に生じた効果」が企業の自己申告
回答がこのリストに触れたかを数えた(弱点への到達)。 弱点リストは当社が Claude(Anthropic)を使って当てはめ、人が原典と照合して確定した。回答を見てから足したものは無い。 また、資料Bには資料Aにしかない弱点を5つ用意し、**資料Bに無い弱点を指摘したら「空振り」**として数えた(読まずに型を当てはめているかの検査)。
2-4. 採点
- 採点者は AI 2名: Claude Fable 5.1(Anthropic)と GPT-6 Astra(OpenAI)。それぞれ独立に採点
- どのモデルの回答か伏せて、同じ資料・設問の回答を並べて渡した(盲検。採点者にモデルを推測させない)
- 採点項目は3つ
- 品質(3段階): 3=そのまま判断材料に使える/2=手を入れれば使える/1=使えない
- 事実誤り: 原典と矛盾する記述の件数
- 弱点への到達: 2-3 のリストのうち触れた数(品質とは足さない)
- 何を見るかと弱点リストは、回答を生成する前に書面で決めた。品質3段階の意味づけだけは、生成の後・採点の前に補足した。以後は変えていない
2-5. 段階
| 段階 | 実施日 | 内容 |
|---|---|---|
| ① クラウドで15モデル比較 | 2026-09-15〜16 | メモリ帯(96GB・256GB・512GB)ごとに動かせるモデルを、OpenRouter 経由で同一条件(温度0・出力上限16,000トークン・fp8 指定)で比較。87本 |
| ② ばらつきの測定 | 2026-09-16 | 3モデル × 3問 × 3回。同じ条件でも採点が何段階動くか |
| ③ 実機(96GB)で測定 | 2026-09-23 | Mac Studio で Qwen3.8-27B を動かし、①と同じ6問 |
| ④ 原因の切り分け | 2026-09-23〜24 | 考える量・重みの精度・作業メモリの精度を1つずつ変えて同じ6問 |
3. 結果① クラウドでの15モデル比較(2026-09-15〜16)
メモリ帯ごとの「そのまま使える率」(2名の判定を両方数える):
| 帯 | そのまま使える率 | 判定数 |
|---|---|---|
| 512GB 帯(4モデル) | 40% | 48 |
| 256GB 帯(3モデル) | 44% | 36 |
| 96GB 帯(5モデル) | 26% | 42 |
| 小型(9B・1モデル) | 0% | 12 |
- 256GB と 512GB に読み取れる差は無い。ばらつき測定で、512GB 帯の最良(GLM-5.3)と 256GB 帯の最良(GLM-5.3-Flash)は9判定すべて同じ評価だった
- 96GB 帯は明確に落ちる。96GB 帯の最良は Qwen3.8-27B(そのまま使える率 58%)
- 品質と「弱点を見抜く力」は別物。商用の最上位(gpt-5.6-sol)は品質では 256GB 帯の最良と並んだが(83%)、q2 での弱点への到達は 14 件で、256GB 帯・512GB 帯の最良(各 8 件)より明確に多かった
- 事実誤りは品質と別に効く。96GB 帯の2モデルは、品質2の回答でも事実誤りが20件を超えた
- 空振りはほぼ出なかった(87本中1件)。読まずに型を当てはめるモデルは、ほぼいなかった
ここまではクラウドでの fp8 の結果。手元の機械では、メモリに収めるためにさらに圧縮する。そこで実機で測った。
4. 結果② 実機(Mac Studio 96GB)での測定(2026-09-23)
4-1. 環境
- Mac Studio(Apple M5 Ultra・メモリ 96GB・macOS 27.0)
- Ollama 0.34.3・モデル
qwen3.8:27b(GGUF・Q4_K_M=重み 4bit・17GB) - 文脈長 131,072 トークン・温度0・出力上限 16,000
- Ollama の既定で、作業メモリ(KV キャッシュ)は 8bit(q8_0)
4-2. 速度 — 合格
| 結果 | 事前に決めた基準 | |
|---|---|---|
| 10万トークンの読み込み(prefill) | 約3.3〜3.8分(毎秒 447〜476 トークン) | 10分以内 |
| 同じ資料への2問目(読み込み済みを再利用) | 最初の1文字まで 5.4秒(新しく読んだのは差分だけ) | — |
| 生成速度(decode) | 毎秒 18.6〜25.1 トークン | 15以上 |
実務では、資料を最初に読み込ませて、同じ会話の中で質問を重ねる使い方になる。その場合は2問目以降ほぼ待たない。
4-3. 品質 — 整理はクラウドと同等、弱点への到達は大きく低下
| 6問 × 2名 | そのまま使える率 | 事実誤り | 弱点への到達 |
|---|---|---|---|
| 実機 Qwen(重み 4bit) | 33% | 9 | 4 |
| クラウド Qwen(fp8) | 33% | 9 | 14 |
| クラウド GLM-5.3-Flash(256GB 級の代わり) | 75% | 9 | 36 |
同じモデルなのに、手元に載せると弱点への到達が 14 → 4 に落ちた。
5. 結果③ 原因の切り分け(2026-09-23〜24)
5-1. 考える量ではなかった
Ollama の既定の「思考の量」はクラウドより少なかったため、最大(xhigh)にして同じ問いを解かせた。
- 弱点への到達は 4 のまま(5問で比較)。品質はむしろ下がり(そのまま使える率 40% → 10%)、回答が一般論に寄った
- 6問中2問は、出力上限 16,000 トークンの中で答えまでたどり着かなかった
5-2. 圧縮(量子化)だった
条件を1つずつ変えて同じ6問を解かせた。
| 条件 | 弱点への到達 | 読み込み(tok/s) | 生成(tok/s) |
|---|---|---|---|
| 重み 4bit・作業メモリ 8bit(Ollama の既定) | 3〜4 | 447〜476 | 18.6〜25.1 |
| 重み 4bit・作業メモリ 16bit | 7 | 448〜476 | 20.7〜30.5 |
| 重み 8bit・作業メモリ 8bit | 9 | 446〜474 | 18.7〜19.4 |
| 重み 8bit・作業メモリ 16bit | 9 | 453〜477 | 24.0〜24.7 |
| (参考)クラウド fp8 | 13〜14 | — | — |
- 重みの圧縮と作業メモリの圧縮の両方が効いていた。どちらを弱めても戻る方向に動いた
- 両方を弱めても 9 で頭打ち。これが 96GB の機械で Qwen3.8-27B を動かしたときの上限
- 読み込みの速さはどの条件でもほぼ同じ(約3.3〜3.8分)。重み 8bit+作業メモリ 16bit のメモリ使用は約37GB(重み 29GB+作業メモリ 8GB)【当方計算】
- 生成速度は、同じ設定でも回によって揺れた(重み 4bit・作業メモリ 8bit は、別の回では毎秒 24〜26)。条件による生成速度の差は読まない。どの条件も事前に決めた基準(15以上)は満たした
5-3. 採点の安定性
- 同じ回答を別の回で採点し直しても、弱点への到達の合計は完全に同じだった(4種類とも 9・7・13・36)
- 「そのまま使える率」は採点し直すと動く(同じ評価になったのは 48判定中37)。品質の小さな差は読まない
実例: 同じ問いへの2つの回答
6問それぞれについて、96GB 実機の最良設定(Qwen3.8-27B・重み 8bit・作業メモリ 16bit)と、256GB 級の代わりに測った GLM-5.3-Flash(クラウド fp8)の回答を並べる。どちらも 2026-09-24 の同一採点回のもので、講評は採点者2名(Fable=Claude Fable 5.1/Astra=GPT-6 Astra)の判定理由の原文。回答の本文には手を加えていない。
品質は 3=そのまま判断材料に使える/2=手を入れれば使える/1=使えない。「気づいた弱点」は 2-3 の弱点リストのうち回答が触れたと判定されたもので、括弧内は判定した採点者。
資料A(電気保安のスマート化 調査報告書)|q1 論点の構造化
96GB 実機・Qwen3.8-27B(重み 8bit・作業メモリ 16bit=96GB の最良設定)
- 品質: Fable 2 / Astra 2
- 気づいた弱点: なし
- 事実誤り: Fable 0 件 / Astra 3 件
- 講評(Fable): 6層×2〜3論点に根拠を併記し数値は正確だが、各論点が要約文で判断の問いになっておらず、層は並列テーマで上下関係がない。第3章・第6.1節の根拠は本資料(第1〜2章)で確認できず、調査データの限界への言及もない。
- 講評(Astra): 設備差・導入障壁・データ活用を階層的に整理し、節や表との対応も示しているが、各論点は現状説明が中心で、何を選択・判断するかの具体化が不足している。推進施策の重複を整理し、提供範囲外の第3章・第6章への参照を利用可能な根拠に置き換えれば使える。
回答の全文を読む
電気保安スマート化推進に関する意思決定論点(階層構造)
第1層:KPI達成の全体像と未達領域
論点1-1:2025年度(ターゲットイヤー)の個別技術KPI達成率は66.7%(24中16)。未達の2技術は「AI・統計手法による業務支援」に集中し、高度なデータ活用技術がボトルネック。
→ 根拠:第2.4節(全電気設備分析)、第3章(KPI分析結果)
論点1-2:設備別で達成率に深刻な格差(太陽電池83.3%/火力75.0%/水力66.7%/送配電50.0%/需要設備29.2%/風力12.5%)。風力・需要設備は構造的制約が主因。
→ 根拠:第2.3.1〜2.3.6節(各設備の個別技術分析結果)
第2層:2026〜2030年実装を阻む上位障壁
論点2-1:費用・採算性が最大の障壁(全設備68.5%が課題回答、「とても重要」62.7%)。事業規模に関わらず投資判断が困難。
→ 根拠:第2.4節 設問4、Table 2-42
論点2-2:安全性・サイバー対策(51.7%)と法・規則・手続き(33.6%)が次点。ドローンの「レベル4飛行」規制が郊外・洋上設備の運用拡大を直接制約。
→ 根拠:第2.4節 設問4、第2.3.5節(送配電・変電所の業界現状)
論点2-3:専門人材不足(技術力・開発力32.2%、推進リーダー25.5%)が中小事業者に特に深刻。人事異動で進捗が停滞する事例も確認。
→ 根拠:第2.4節 設問4、第2.3節(業界団体情報交換の例5)
第3層:データ活用という前提条件の未整備
論点3-1:データ取得・保存は91.3%が実施済みだが、活用未着手・検討中が45.0%。AI・CBM化の前提が未整備であり、これが第1層の未達と直結。
→ 根拠:第2.4節 設問1、Table 2-39
論点3-2:2026〜2030年の活用計画では「異常予兆検知」が最優先(AI活用41.6%)だが、寿命予知・保守計画策定は従来の統計手法がAIを上回り、高度AIへの移行には時間が必要。
→ 根拠:第2.4節 設問1、Table 2-39
第4層:設備特性に起因する制度・技術的制約
論点4-1:風力発電は海外製品が中心でセンサー後付けが保証対象外。遠隔監視技術の導入がメーカー依存に陥り、法的処置の明確化を含む制度整備が不可欠。
→ 根拠:第2.3.3節(風力発電)、第2.3.3(3)節(業界現状)
論点4-2:需要設備は高圧の9割以上が外部委託。委託先でのスマート保安導入環境が不透明で、設置者への理解促進と委託先への技術伝達メカニズムが未構築。
→ 根拠:第2.3.6節(需要設備)、第2.3.6(3)節
論点4-3:火力発電は脱炭素化・稼働率低下により投資回収見通しが立たず、スマート保安投資の優先度が事業者ごとに分岐。競争分野であるため画一的推進は困難。
→ 根拠:第2.3.1(3)節(火力発電の業界現状)
第5層:AI技術の成熟度と実装フェーズ
論点5-1:AI技術の実装・運用は53.7%が「予定なし・検討中」。実装済みでも「一部運用」が主流で、CBM化は10.7%に留まる。高度AI(予兆検知・寿命診断)は検証未完。
→ 根拠:第2.4節 設問3、Table 2-41
論点5-2:各設備で「リリース&トライ」による段階的導入が共通戦略だが、運用実績の蓄積が不十分で、費用対効果の定量的検証が完了していない。
→ 根拠:第2.3.1節(火力発電のリリース&トライ記述)、第2.4節 設問3
第6層:推進体制と政策提言
論点6-1:民間単独では開発・実装に莫大な時間・費用を要するため、国家規模の基盤整備(AI開発環境、人材育成、共同実証プロジェクト)が各設備で共通して望まれている。
→ 根拠:第2.4節 設問4、第6.1節(NITEからの提言)
論点6-2:実装段階では、中小事業者が活用できる環境整備と、リリース&トライを可能とする特例制度・法規則の緩和が不可欠。特に需要設備・風力では規制緩和が導入の前提条件。
→ 根拠:第2.4節 設問4、第6.1.2節、第2.3.3節・第2.3.6節
GLM-5.3-Flash(クラウド fp8・256GB 級の代わり)
- 品質: Fable 3 / Astra 2
- 気づいた弱点: H8 「回答者が同一である保証がない」かつ「回答数が設備間または年で大きく異なる」の両方(Fable)
- 事実誤り: Fable 0 件 / Astra 2 件
- 講評(Fable): 7論点の階層で、1-2「一律KPIを続けるか業界別に再設計するか」、4「個別対応の要否」、6「無記名調査の限界を前提とした評価手法の継続可否」のように判断の問いが埋め込まれ、総括で4点に絞り直している。根拠は節・設問番号で対応し、数値は件数付き(136事業者91.3%/102事業者68.5%/送配電の法規制62.5%第3位/風力3技術達成87.5%未達 等)ですべて原典と一致。§6で調査の限界(無記名・回答数の年度増減・積極事業者バイアス)を判断の前提条件として明示している点が、他の回答にない実務上の価値。
- 講評(Astra): 主要論点を見出しと下位項目で整理し、節・設問への根拠対応と調査上の留意点も示している。一方、目標見直しと今後の推進方針が複数箇所に分散し、現状要約にとどまる項目もあるため、具体的な判断事項を軸に統合する手直しが必要である。
回答の全文を読む
意思決定に必要な論点の構造化
1. KPI(2025年導入目標)の達成評価と次期計画の方向性
1-1. 全体はおおむね順調だが、AI関連2項目が未達成
- 全電気設備の24個別技術中16技術(66.7%)が評点目標を達成。KPI集約7技術のうち5技術は達成したが、「点検結果の自動判定」と「総合評価による寿命予知」(いずれもAI活用分類)が未達成。「試験・評価中」「検討中」が5割、「予定無し」が3割強。
- 根拠:2.4 全電気設備の分析結果(1)
1-2. 業界間格差が大きく、次期KPIの設計方針が問われる
- 達成率が高いのは太陽光(83.3%、KPI3項目全達成)、火力(75.0%)。低いのは風力(達成わずか3技術、87.5%未達)、需要設備(29.2%)。一律のKPIを続けるか、業界別・技術別に再設計するかの判断材料。
- 根拠:2.3.1/2.3.3/2.3.4/2.3.6 各(1)個別技術
2. 「データはあるが活用できない」停滞が次段階のボトルネック
- データ取得・保存済みは136事業者(91.3%)に対し、活用は45.0%が「未活用・予定なし」か「検討中」。業界別では水力58.8%、需要53.8%、風力・太陽光が各50.0%。スマート化推進の第一歩として環境整備と実行力ある施策が必要と分析。
- 2026-2030年の活用先は「異常予兆検知」に集中(統計33.6%、AI41.6%)し、それ以外はAIより統計手法が主流の見込み。
- 根拠:2.4 設問1、2.3.2/2.3.3/2.3.4/2.3.6 各設問1
3. 共通課題への支援策の設計
3-1. 最大課題は費用・採算性
- 「研究開発・導入・運用の費用あるいは採算性」が102事業者(68.5%)で最多。「とても重要」が62.7%を占め、事業規模を問わず投資判断の壁に。
- 根拠:2.4 設問4(ア)(イ)
3-2. 国家規模プロジェクト・制度整備への要望
- 各業界とも「民間単独では莫大な時間と費用」を理由に国家規模の基盤整備を推奨。加えて中小事業者が活用できる環境整備、リリース&トライを可能とする特例制度や法規則の緩和の必要性に言及。
- 根拠:2.3.1〜2.3.6 各設問4、2.4 設問4(イ)
3-3. 法規制対応は送配電で特に顕著
- 送配電では「法・規則・内規・手続き」が62.5%で第3位の課題。ドローンのレベル4飛行(有人地帯目視外飛行)の実現が活用拡大の鍵とされる。
- 根拠:2.3.5 設問4、2.4 設問2
4. 業界固有の構造課題(個別対応の要否)
4-1. 風力:海外製品依存という構造制約
- 風車は海外製品が多く、センサー後付けは保証対象外になる恐れがあり、メーカー主導でない導入が困難。「法的に認める処置や制度整備が求められる」。
- 根拠:2.3 情報交換欄、2.3.3(1)
4-2. 需要設備:外部委託構造(9割超)が導入を阻害
- ドローン・ロボットは「予定無し」が9割前後。設置者に導入メリットが見出せない意見が多く、設置者の理解促進と外部委託のボトルネック整理が必要。
- 根拠:2.3.6(1)(2)(3)
4-3. 火力:稼働縮小下で投資回収の見通しが不透明
- 休廃止が新設を上回る見込みで、スマート保安投資の回収を長期展望しにくい状況。個社の競争力に関わる分野である点も考慮。
- 根拠:2.3 情報交換欄、2.3.1(3)
5. 技術進展に伴う目標・計画の見直し(リリース&トライ)
- 技術革新・AI活用拡大により当初想定と異なる運用が可能となり、導入計画の見直しが回答に影響(空中ドローンの目視外飛行化、ウェアラブルのスマホ代替、センサーの高機能品置換など)。環境関連センサー・自走ドローン・寿命予知は達成率80%未満で技術の置換・移行が進行。費用対効果が想定以下の場合は中止・保留も発生。
- 根拠:2.3 情報交換欄(例1〜4)、2.4(1)
6. 調査データの限界(判断の前提条件)
- 原則無記名のため同一事業者の継続回答は保証されず、回答数も年度により増減。一部設備では積極的な事業者・先進事業者の回答が多いバイアスがある。年次比較やKPI評価を政策判断に用いる際はこの限界を織り込む必要。
- 根拠:Table 2-1付近の注記、2.3 情報交換欄
7. 2026年以降の推進方針の重点
- ロボット・ドローン:68.5%が何らかの活用を想定し「点検」「災害時被害把握」が最多用途。「一部運用」中心の段階的展開と、レベル4飛行との組み合わせが促進の前提。
- AI:予定なし・検討中が53.7%と過半。高度なAI(予兆検知・寿命診断・CBM)は安全確保・学習データ・結果評価の課題があり時間と検証を要し、先進事業者による堅実なリリース&トライが現実的方針。
- 根拠:2.4 設問2(ア)(イ)、設問3(ア)(イ)
総括:意思決定の核心は、①全体進捗を踏まえつつAI関連KPI未達への対応、②業界格差(風力・需要設備)への個別支援、③費用・人材課題への国家規模基盤整備の要否、④無記名調査の限界を前提とした評価手法の継続可否、の4点に集約される。
資料A(電気保安のスマート化 調査報告書)|q2 欠けている情報
96GB 実機・Qwen3.8-27B(重み 8bit・作業メモリ 16bit=96GB の最良設定)
- 品質: Fable 2 / Astra 3
- 気づいた弱点: H10 導入状況しか測っておらず、保安成果(アウトカム)や対照群がない(両名)
- 事実誤り: Fable 0 件 / Astra 0 件
- 講評(Fable): 6対とも「書かれていない→下せない判断」の形式は明確で、費用データ・規制条項・保安アウトカムの3点は報告書の数値(68.5%・33.6%・9割外部委託)に結びついている。一方、サイバーセキュリティ基準・相互運用性規格・補助金制度設計は調査報告書に元々書かれる性質の情報ではなく汎用的な指摘で、報告書自身が明記している回答偏り・無記名・回答数変動といった判断限界には触れていないため、重要でないものが混ざる段階。
- 講評(Astra): 費用、安全成果、制度、セキュリティ、支援制度、相互運用性について、不足する情報を具体化し、投資・制度設計・運用設計の判断と対応させている。調査方法の批判は少ないが、実装に必要な追加調査の論点として選別と対応が成立している。
回答の全文を読む
この報告書は、電気保安のスマート化推進に関する業界別アンケートの現状把握には有用である。しかし、意思決定に必要な以下の情報が欠落しており、各項目の欠如により特定の判断が下せなくなる。
1.「具体的な費用対効果(ROI)の定量データ」が書かれていない
→ どの技術にどの規模で投資すべきかの「投資優先順位付け」が下せない。
報告書は「費用・採算性」を68.5%の事業者が課題と回答したと示すが、実際の導入コスト、ランニングコスト、人件費削減額、事故防止による損失回避額などの数値が一切ない。KPI達成に向けた追加投資の規模感や、中小事業者が負担可能な水準が不明なため、予算配分や補助金設計の判断ができない。
2.「具体的な法規制のボトルネック条項」が書かれていない
→ 規制改革の優先順位や改正内容の「制度設計判断」が下せない。
「法、規則、内規、手続き等」を33.6%が課題と回答しているが、電気事業法施行規則のどの条項が障壁か、ドローン目視外飛行(レベル4)の認可でどこが詰まっているか、AI判定を保安点検の代替として認める法的根拠が不足しているかなどが特定されていない。規制緩和の方向性を決定できない。
3.「サイバーセキュリティの適用基準・要件」が書かれていない
→ スマート保安システムの「セキュリティ設計判断」が下せない。
「安全性・信頼性・サイバー対策」を51.7%が課題と回答しているが、IoT機器接続時に適用すべき基準(IEC 62443等)、通信暗号化要件、サプライチェーンリスク管理、インシデント対応手順が記載されていない。システム導入の可否やセキュリティ投資規模の決定ができない。
4.「技術導入前後の事故率・安全指標の変化データ」が書かれていない
→ 技術導入の「リスクベースの優先順位付け」が下せない。
導入率の推移は示されるが、ドローン点検導入で高所作業の墜落事故が何%減ったか、AI予兆検知で突発停止が何件防止されたかなどの安全アウトカム定量データがない。投資の正当性を示す根拠が不足し、経営層への説明や保険料率交渉に活用できない。
5.「中小事業者向けの具体的支援制度の設計」が書かれていない
→ 中小事業者の導入時期予測や「支援策の設計判断」が下せない。
繰り返し「国家規模の基盤整備」を提言するが、既存補助金との関係、スマート保安導入に特化した補助金の要件・上限額・申請手順、共同利用プラットフォームの運営主体が示されていない。需要設備(高圧の9割が外部委託)や中小水力・風力事業者が実際に導入を始める時期の予測ができない。
6.「技術間の相互運用性(インターオペラビリティ)基準」が書かれていない
→ 複数技術の「統合導入計画」が策定できない。
ドローン取得画像をAI判定に渡す際のデータ形式、センサー類の通信プロトコル統一、メーカー間データ連携規格が記載されていない。個別技術は導入できても、システム全体として機能するスマート保安基盤の構築計画が立てられない。
GLM-5.3-Flash(クラウド fp8・256GB 級の代わり)
- 品質: Fable 3 / Astra 3
- 気づいた弱点: H7 配布数の記載がなく回収率が不明である(Fable) / H8 「回答者が同一である保証がない」かつ「回答数が設備間または年で大きく異なる」の両方(両名) / H10 導入状況しか測っておらず、保安成果(アウトカム)や対照群がない(両名)
- 事実誤り: Fable 0 件 / Astra 0 件
- 講評(Fable): 8対すべてが報告書の具体的記述(149件・風力13→16・需要設備20→13・未達87.5%/70.8%・高圧85万件・9割外部委託・予定無し9割・回答偏りの自認・『機動的な見直し』)に結び付けられ、下せない判断がKPI達成判定の信頼性評価・支援対象の選定・KPI改定や期限延長の是非など、本報告書が支えるべき判断そのものに向いている。点5『予定無し』の理由の切り分けは施策方向を正反対に変える独自の指摘で、総括で1〜4を優先と明示しており選別も効いている。項目数は多いが、そのまま材料に使える。
- 講評(Astra): 代表性・経年比較・費用・保安成果を優先事項として明示し、未導入理由や外部委託構造も施策の選択に結び付けている。8項目という件数ではなく、同じ観測結果でも原因によって取るべき施策が変わることを具体化している点を評価した。
回答の全文を読む
本資料に書かれていないことと、それにより下せない判断
本報告書は「導入状況の測定と可視化」に特化した構成であり、測定値を意思決定に使うために必要な前提情報と、測定の先にある成果・対応策の情報が欠落している。以下、重要なものに絞って示す。
1. 回答事業者の属性と母集団の規模
【書かれていないこと】 149事業者の内訳(事業規模・設備規模・自社保守か外部委託か)、配布数に対する回収率。報告書自身「スマート保安推進に積極的な事業者の回答が多いと推測される」と自認しながら、補正するデータを示さない。
【下せない判断】 結果を業界全体に一般化してよいかの判断。KPI達成率が業界全体の実態なのか先進事業者層の実態なのか判別できず、支援策の対象(中小か大規模か)や優先すべき設備の選定ができない。
2. 経時比較の前提(同一事業者の継続性)
【書かれていないこと】 無記名のため同一事業者が毎年回答しているか保証されず、回答数も変動している(風力13→16、需要設備20→13)。母集団変動が評点推移に与えた影響の定量化がない。
【下せない判断】 評点の増減を「実質的進捗」として評価するかどうか。風力(目標未達87.5%)や需要設備(未達70.8%)の「後退」が実態なのか回答者交代による見かけ上のものか区別できず、KPI達成判定自体の信頼性評価ができない。
3. 費用と効果の定量データ
【書かれていないこと】 技術別の導入・運用コスト、効果(工数削減、事故防止、投資回収期間)の実測値。課題の首位は「費用・採算性」(68.5%)でありながら、費用データは一切示されない。
【下せない判断】 ①中小事業者の個別投資判断、②補助金・インセンティブの水準設計、③国家プロジェクトに投資すべき技術の優先順位付け。「国家規模でのプロジェクトによる基盤整備が望ましい」という繰り返しの提言を、どの技術に・どの規模で・どの順に具体化するかが決められない。
4. 保安成果(安全性)との紐付け
【書かれていないこと】 スマート保安技術の導入と事故率・ヒヤリハット・点検品質の関係。導入率のみが測られ、安全性向上という本来の目的変数が測られていない。
【下せない判断】 スマート保安が目的を達成しているかの検証。導入率が上がっても事故が減らなければKPIの妥当性自体が崩れる。また「遠隔監視導入を条件とした点検周期延伸」等の規制緩和の可否も、成果データなしでは判断できない。
5. 「予定無し」の理由の切り分け
【書かれていないこと】 「予定無し」と回答した理由の体系的調査。団体との情報交換で「費用対効果が想定ほど得られない」「作業員の理解が得られない」等が例示されるが、設問化されていない。
【下せない判断】 未達成技術への対応方針。需要設備でドローン等が「予定無し9割前後」なのが「不要と判断された」結果なのか「障壁のため断念した」結果なのかで、必要な施策は正反対になる。切り分けなしにはKPI改定・期限延長・資源再配分を決められない。
6. 外部委託市場の実態
【書かれていないこと】 高圧需要設備の9割以上、太陽光の大部分を担う電気保安法人・O&M事業者側の技術導入状況と委託契約の実態。報告書は「外部委託におけるスマート保安に資する技術が不透明」と認めつつ、実態データを示さない。
【下せない判断】 最大セグメント(高圧需要設備約85万件)への施策設計。設置者側にインセンティブを与えるのか、受託側の標準化を進めるのか、保安規程・委託契約をどう変えるのかが、委託構造の実態なしには選べない。
7. 規制・制度の具体的ボトルネック
【書かれていないこと】 「法・規則・内規・手続き等」を課題とする33.6%の内実。どの法令・条項が障壁か(風力でのメーカー保証とセンサー後付けの問題、レベル4飛行の要件、AI判定の保安規程上の位置づけ等)が特定されていない。
【下せない判断】 規制見直しの項目決定と優先順位付け。「機動的な見直しが重要」との指摘があるが、対象が特定されなければ行政は着手できず、事業者側も待つしかない。
8. AI・自動判定の信頼性検証と責任体制
【書かれていないこと】 AI判定の精度実績、誤判定時の保安責任の所在、第三者検証の枠組み。「安全性・技術的信頼性」は課題の2位(51.7%)でありながら、検証データも制度設計の議論もない。
【下せない判断】 点検結果の機械自動判定と寿命予知(全設備でKPI未達の2項目)への業務移転の可否。誤判定時の責任が設置者に残るのか不明のままでは、2026年以降この2項目を推進する運用設計も、AI判定を保安判断に用いることの承認もできない。
総括
欠落は「代表性(1・2)」「費用と成果(3・4)」「原因の切り分け(5)」「施策対象の実態(6)」「実行手段(7・8)」に集約される。中でも1〜4は、本報告書の中心的数値である「KPI達成率」の解釈可能性そのものに関わる。また、繰り返し登場する「国家規模プロジェクト」の提言には予算・体制・スケジュールが伴っておらず、提言の採否と資源配分の判断も別途の情報を要する。次年度調査では回答者属性の把握と、費用・保安成果の定量収集が最優先の補強項目と考える。
資料A(電気保安のスマート化 調査報告書)|q3 反対仮説
96GB 実機・Qwen3.8-27B(重み 8bit・作業メモリ 16bit=96GB の最良設定)
- 品質: Fable 3 / Astra 2
- 気づいた弱点: H2 目標値が回答者の自己申告に由来する(Astra) / H10 導入状況しか測っておらず、保安成果(アウトカム)や対照群がない(両名)
- 事実誤り: Fable 0 件 / Astra 1 件
- 講評(Fable): 4前提で前提/反対仮説/検証事実が区別・対応し、前提3(非回答事業者への3問の簡易調査)と前提4(同一事業者の「試験・評価中」滞留率)の検証事実は匿名性の下でも取得可能で仮説を直接判定できる。「一部実施は過渡期ではなく定常状態」は資料の楽観的解釈(リリース&トライ)に真に対立する仮説で、前提2の反対仮説が資料自身の「他センサーへの置換」説明と重なり反対仮説として弱い点はあるが、結びで前提1・3に優先度を付け選別も効いている。
- 講評(Astra): 4つの前提を区別し、成果の群間比較、非回答者調査、同一事業者の継続状況など、対応する確認事実を具体化している。ただし、第2項の技術置換は原典自身も提示する説明で反対仮説としての対立が弱く、第4項の3年・5年・30%という判定条件にも根拠と整合性の補足が必要である。
回答の全文を読む
本報告書の暗黙の前提と反対仮説
前提1:導入率の向上=保安水準の向上
本報告書は、24の個別技術について「実施済み」「一部実施」などの導入段階を評点化し、KPI達成率として位置づけている。この構造は、技術が現場に置かれていること自体が保安の改善に直結するという暗黙の前提に立っている。事故率や故障率、人的災害件数といったアウトカム指標は一切測定されていない。
反対仮説: 導入率は上がっているが、実際の保安アウトカム(事故・故障・人身災害)は改善していない、あるいはサイバー攻撃面での新たな脆弱性によりむしろ悪化している。
検証すべき事実: 2021年度から2025年度にかけて、スマート保安技術を「実施済み」と回答した事業者群と「予定無し」と回答した事業者群で、電気設備の事故件数・故障率を比較する。具体的には、経済産業省の電気設備事故報告統計を事業者規模・設備種別でマッチングし、導入群と非導入群の事故率推移に有意な差があるかを確認する。
前提2:2021年策定の技術フレームワークが2025年にも有効である
KPIは2021年度のアンケートで事業者が回答した「2025年の取組想定」に基づき設定され、6大項目・24技術の区分が5年間不変に用いられている。報告書自身も「技術革新により当初想定と異なる運用が可能となった」と認めているが、測定軸そのものは更新されていない。
反対仮説: 2021年時点の技術区分は既に陳腐化しており、例えば「環境関連センサー(匂い、埃等)」が後退しているのは技術の失敗ではなく、より高度な統合型センサーやAI画像認識に置換された結果である。この場合、評点の「後退」は進捗の停滞ではなくフレームワークの非適合を意味し、KPI達成率という指標自体が無意味化している。
検証すべき事実: 2025年度に「環境関連センサー」で「予定無し」と回答した事業者のうち、実際に代替技術(統合型IoTセンサー、AI画像解析による異臭・異物検知等)を導入・運用している事業者の割合を、追跡インタビューまたは設備点検記録の照合により特定する。
前提3:無記名・任意回答のアンケートが業界全体の進捗を代表する
回答は149事業者から得られたが、無記名であり同一事業者の継続回答が保証されない。報告書も「スマート保安推進に積極的な事業者からの回答が多いと推測される」と自己批判的に記述している。
反対仮説: 回答バイアスにより、実際の業界平均導入率は報告値より有意に低い。特に需要設備(高圧の9割が外部委託)や中小水力・風力事業者では、回答しない事業者ほど導入が遅れており、集計値は「先進層の自己申告」に過ぎない。
検証すべき事実: 電気保安協会全国連絡会や東京電気管理技術者協会を通じて、2025年度アンケートに回答しなかった事業者(推定で数百社規模)に対し、電話または対面による簡易調査(3問程度:タブレット使用有無、ドローン使用有無、AI活用有無)を実施し、回答群と非回答群の導入率に統計的有意差があるかを確認する。
前提4:「一部実施・試験評価中」は完全導入への過渡期である
報告書は「リリース&トライにより評価を実施している段階」として、多数の事業者が「一部実施」や「試験・評価中」に留まることを肯定的に解釈し、今後の拡大を想定している。
反対仮説: 「一部実施」は過渡期ではなく、費用対効果が不透明な技術における定常状態である。特にAI・CBM関連では、データ蓄積が十分でない限り精度が向上せず、事業者が「試験」の段階で長期停滞する。2021年から2025年まで4年間「試験・評価中」で動いていない技術項目が存在すれば、この前提は崩れる。
検証すべき事実: 2021年度から2025年度まで5年連続で回答している同一事業者(業界団体経由で特定可能な場合)について、「試験・評価中」の回答が3年以上継続している技術項目の割合を算出する。30%以上が5年間同一段階に留まっている場合、「過渡期」という解釈は支持されない。
以上4点のうち、特に前提1と前提3は、本報告書が政策提言(KPI見直し、国家規模の基盤整備等)の根拠として機能し得るかどうかを左右する核心的な問題である。導入率の数字が「保安が向上している」ことの証拠として通用するか、またその数字が業界全体を代表しているか、この二点の検証がなされない限り、報告書の政策提言は循環論法に留まるリスクがある。
GLM-5.3-Flash(クラウド fp8・256GB 級の代わり)
- 品質: Fable 3 / Astra 2
- 気づいた弱点: H2 目標値が回答者の自己申告に由来する(両名) / H3 無回答の扱い(0点算入)か、「予定無し」と「空白」が区別できない点(両名) / H8 「回答者が同一である保証がない」かつ「回答数が設備間または年で大きく異なる」の両方(両名) / H9 全項目が無記名の自己申告で、第三者検証がない(Fable) / H10 導入状況しか測っておらず、保安成果(アウトカム)や対照群がない(両名)
- 事実誤り: Fable 0 件 / Astra 0 件
- 講評(Fable): 6前提すべてで前提/反対仮説/確認事実が区別・対応し、確認事実は固定パネル再構成・客観的裏付けとの一致率・事故統計との突合・正解ラベル付与率・制度改正の自然実験・感度分析と、1つずつ実行可能な形に落ちている。回答数27→13→16、11技術(45.8%)後退、91%収集/45%未活用、センサー後付けの保証問題、周期延伸など資料固有の数字・記述に根拠を置き(原典と照合済み)、結びで前提1・3に優先度を付けて選別も効いている。
- 講評(Astra): 年次比較、評点処理、目標の由来などについて、前提・反対仮説・検証方法を具体的に対応させ、優先順位も示している。ただし、固定パネルで後退がなければ年次比較全体が無効、事故統計との相関がなければKPIを再設計すべき、という判定は提示した事実から導ける範囲を超えており、修正が必要である。
回答の全文を読む
本報告書の暗黙の前提と反対仮説
本報告書は、5段階評点の年次比較と2021年設定目標との対比によって「スマート保安の進捗」を論じている。その分析実行の背後には、少なくとも以下の前提が暗黙に置かれている。報告書は制約を形式的に断ってはいるが、分析は制約が存在しないかのように進めている点に問題がある。
前提1:回答母集団が年次的に比較可能である
暗黙の前提:2021年・2024年・2025年の回答事業者群は同質であり、評点の増減は「業界の進捗・後退」を表す。
反対仮説:無記名で継続性は保証されず、回答はスマート保安に積極的な事業者に偏る。評点の増減は、事業者の入れ替わり(小規模事業者の参入・離脱)や担当者交代による「回答スタイルの変化」のアーティファクトであり、個々の事業者の導入は停滞している可能性がある。特に風力発電は回答数が27→13→16と激変しており、「11技術(45.8%)が後退」という結論は母集団変化だけで生じ得る。
確認すべき事実:設備規模・事業形態等の属性で突合し、同一事業者の固定パネルを再構成して評点変化を再計算する。パネル内でも後退が見られれば報告書の解釈は補強され、見られなければ年次比較自体が無効となる。
前提2:評点が「導入実態」の妥当な尺度である
暗黙の前提:「実施済み5点〜検討中1点」の平均は導入率の代理指標であり、0.1〜0.2単位の差に意味がある。
反対们説:評点は「宣言の集計」であり実装と乖離する。「一部実施」には長期滞留する試験導入が含まれ、「検討中」からの微増は何も導入されずとも生じる。また「空白」と「予定無し」を同一の0点とする処理は無回答の多い項目の評点を歪める。報告書が「技術置換え・見直し」と解釈するセンサー類の後退(例:環境関連センサー)も、実際には費用対効果が立たない恒久的断念かもしれない。
確認すべき事実:回答事業者の一部抽出し、客観的裏付け(保安規程の該当条項、システム運用記録、投資実績)と回答カテゴリの一致率を検証する。
前提3:KPI達成は政策の成功、ひいては安全性の向上を意味する
暗黙の前提:2021年度に事業者が記載した「2025年の取組想定」は達成すべき目標であり、達成率の高さが推進の成果を示す。
反対仮説:「目標」は計画でも政策課題でもなく回答者の楽観的自己予測にすぎず、達成率は予測精度の指標であって政策効果ではない。さらに達成・未達にかかわらず、IoT/AI導入が電気事故の減少に寄与したという証拠は本報告書に一切なく、「安全性の追求」というスマート保安の定義のうち安全性側は完全に未検証のままである。
確認すべき事実:公表されている電気工作物事故統計(件数・重大度)を業界別・年度別の導入評点と突き合わせ、相関(可能なら時差相関)を確認する。相関がなければKPIを事故率等のアウトカム指標に再設計すべきである。
前提4:データを収集していれば活用できる
暗黙の前提:91%がデータ収集しながら45%が活用しないのは、意識・人材・環境整備の問題であり、施策で解決する。
反対仮説:データ自体が活用不能な形で蓄積されている(機種固有形式、故障・保守履歴との紐付け欠如)。風力は海外メーカー機のデータアクセス制約があり、環境を整えても解析対象が成立しない。「AIより従来統計手法が選ばれる」という分布も、AIに必要なデータ品質の欠如の傍証と読める。
確認すべき事実:未活用事業者の蓄積データのうち、故障・修理履歴等の正解ラベルが付与されている割合を調査する。
前提5:阻害要因は費用・人材であり国家プロジェクトが有効な処方箋
暗黙の前提:費用・技術力・人材が上位課題ゆえ、国家規模プロジェクトによる基盤整備と人材育成が有効である。
反対仮説:真の阻害要因は規制・制度・契約構造(風力でのセンサー後付けの保証拒否、レベル4飛行要件、需要設備の周期延伸インセンティブ不在)であり、技術開発支援では需要が喚起されない。逆に制度的インセンティブが整えば、費用負担は民間で吸収されうる。
確認すべき事実:制度改正を自然実験として利用し、例えば需要設備における遠隔監視導入と点検周期延伸の申請・承認件数の推移を比較する。
前提6:少数回答でも業界別の趨勢が語れる
暗黙の前提:風力16、需要設備13といった標本でも、評点差0.1〜0.2単位の議論が成立する。
反対仮説:1事業者あたりの評点寄与は風力で約0.06、需要設備で約0.08であり、2〜3事業者の回答変更で「後退」「停滞」といった定性評価が反転する。業界別差異の多くは統計的ノイズかもしれない。
確認すべき事実:感度分析——回答1件の変更が評点に与える影響幅と観測された年次差の比較(またはブートストラップによる区間推定)を提示する。
結び
優先度が最も高いのは**前提1(母集団の非継続性)と前提3(KPIの意味)**であり、この二つは報告書の結論全体を左右する。次年度調査では、匿名性を保ったまま事業者を識別可能にする属性IDの付与と、事故統計との突合が最小限かつ決定的な改善策となる。
資料B(テレワーク 総合実態調査 報告書)|q1 論点の構造化
96GB 実機・Qwen3.8-27B(重み 8bit・作業メモリ 16bit=96GB の最良設定)
- 品質: Fable 2 / Astra 3
- 気づいた弱点: なし
- 事実誤り: Fable 0 件 / Astra 1 件
- 講評(Fable): 5階層14項目すべてに節番号+図表番号の根拠が付き、数値も原典と一致する。ただし各項目は調査結果の要約に「〜が必要」という一般的示唆を添えた形で、判断の選択肢としての論点化は弱く、通信状況(2-4)など周辺的項目も混ざる。総括の三段階まで読まないと絞り込みが見えない。
- 講評(Astra): 導入判断、労務管理、公平性などを階層化し、各論点を図表や企業事例と対応させている。業務適性の確認から運用設計、公平性確保へ進む判断順序も示され、実務で検討すべき事項が具体的である。
回答の全文を読む
テレワーク導入・運用に関する意思決定論点(階層構造)
1. 導入・継続の判断
1-1 業務のテレワーク適性の棚卸し
未導入企業の最大障壁は「テレワークでできる業務が限られている」(59.1%)であり、そのうち70.3%は「テレワークをする余地は考えられない」と回答している。導入判断の前提として、業務の遂行方法見直しやICT発展による可能性の再評価が不可欠である。
(根拠:Ⅱ-2(3) 図表18・22、Ⅱ-3(16) 図表59・61)
1-2 導入目的の明確化と経年変化の認識
令和2年度は「事業継続性の確保」が主目的(61.3%)であったが、令和7年度は「育児・介護との両立・離職防止」(50.3%)に重心が移っている。導入目的が曖昧なまま運用すると、D社(ヒアリング)のように「ルーズな運用→経営陣の廃止指示」という危機に直面する。
(根拠:Ⅱ-3(15)① 図表57、Ⅲ-1 D社「導入時から現在までの変化」)
1-3 廃止・縮小の意思決定基準
廃止企業の31.1%が「不公平感の発生」を理由に挙げており、未導入企業の94.6%、廃止企業の88.4%が再開・導入意向を持たない。一度廃止すると再開が極めて困難なため、導入前に運用ルールの設計精度を担保する必要がある。
(根拠:Ⅱ-2(4) 図表21、Ⅱ-2(7)(8) 図表24・25)
2. 労務管理の設計
2-1 労働時間の把握方法
自己申告制が主流(30.5%)だが、実態調査(PCログ照合等)を行っている企業は22.7%にとどまる。規模が大きいほど実態調査の割合が高く(1,000人以上で54.0%)、中小企業では管理の甘さがリスクとなる。
(根拠:Ⅱ-3(5)① 図表36、Ⅱ-3(6) 図表42)
2-2 法定時間外・深夜・休日労働のルール
在宅勤務で法定時間外労働を「事前申請制で認める」企業が40.5%ある一方、オフィス勤務時よりテレワーク時の方が時間外労働が多いと回答した企業も存在する。その主因は「育児・介護をしながら仕事を行う」(33.2%)と「上司が進行管理をしづらい」(31.7%)である。
(根拠:Ⅱ-3(7)①④⑤ 図表43・46・47)
2-3 休憩・中抜けの取扱い
「特に決まっていない」が休憩で23.6%、中抜けで37.4%を占め、制度設計が未整備の企業が多い。中抜けを有給休暇として扱うか休憩として扱うかで、労働時間管理の複雑さが大きく変わる。
(根拠:Ⅱ-3(5)⑤⑥ 図表40・41)
2-4 通信状況・在席管理の基準
64.4%の企業が「常時受信可能」を求めているが、1,000人以上では「常に速やかに対応」を求める割合が51.5%と突出する。管理の厳格さと自律性のバランスが、長時間労働抑制と心理的安全性の両立に直結する。
(根拠:Ⅱ-3(9)①② 図表50・51)
3. 公平性と人事評価
3-1 対象者の範囲(正社員限定か)
67.4%が正社員のみを対象としており、非正社員を除外する主因は「業務の指示や進捗確認が難しい」(35.0%)である。規模が大きいほど非正社員を含む割合が高く(1,000人以上で64.6%)、管理手法の整備が前提となる。
(根拠:Ⅱ-3(3)① 図表31、Ⅱ-3(4) 図表35)
3-2 出社者との不公平感
導入企業の29.3%が「不公平感がある」と回答し、300人以上では54.9%に達する。ヒアリングでは、J社の「リスペクトの周知」、M社の「有給日数増加の検討」など、具体的な是正策が示されている。
(根拠:Ⅱ-3(16) 図表59、Ⅲ-1 J社・M社「不公平感の解消」)
3-3 人事評価の公平性
77.2%は「働き方の違いによる評価差はない」と回答するが、D社(ヒアリング)は「顔を合わせないと評価できない」という心理的バイアスを懸念しており、成果指標の明確化が課題である。
(根拠:Ⅱ-3(11) 図表53、Ⅲ-1 D社「現状の課題」)
4. 健康確保・安全管理
4-1 作業環境の確認
81.0%の企業が作業環境(明るさ、室温、机・椅子等)を「いずれも確認していない」。安全配慮義務の観点から、最低限の確認体制の整備が法的リスク低減に必要である。
(根拠:Ⅱ-3(13) 図表55)
4-2 長時間労働の抑制
テレワーク時に「気が緩んでしまう」(13.3%)や「就業終了の感覚が薄れる」(自由記述)という報告がある。C社(ヒアリング)のようにシステムで時間外ログインを不可にする等の仕組みが有効である。
(根拠:Ⅱ-3(7)⑤ 図表47、Ⅲ-1 C社「長時間労働抑制の取組」)
5. 基盤整備と行政支援
5-1 デジタル化の残存課題
「紙の書類・資料が電子化されていない」は令和2年度の37.2%から令和7年度に10.1%へ減少したが、未導入企業では依然9.4%が障壁として挙げる。押印必須業務や取引先の紙文化がボトルネックとなる。
(根拠:Ⅱ-2(3) 図表18、Ⅱ-3(16)② 図表60、Ⅲ-2「課題を感じている企業」)
5-2 行政支援の期待
「費用助成」(31.8%)が最も求められており、在宅勤務実施企業では44.0%に上昇する。廃止企業でも44.9%が費用助成を求めており、導入コストの低減が意思決定の閾値を下げる要因である。
(根拠:Ⅱ-4 図表65・66・67)
総括: 意思決定の核心は「業務適性の棚卸し(1-1)→ 労務管理ルールの事前設計(2-1~2-4)→ 公平性担保の仕組み(3-1~3-3)」の三段階に集約される。令和7年度時点では課題の全体的な改善(図表60)が見られる一方、中小企業では管理手法の未整備(2-1, 4-1)と公平感(3-2)が継続的な意思決定の分岐点となっている。
GLM-5.3-Flash(クラウド fp8・256GB 級の代わり)
- 品質: Fable 3 / Astra 3
- 気づいた弱点: TB4 「導入」の定義の緩さ または 実施率1割以下が63.7%(両名)
- 事実誤り: Fable 0 件 / Astra 0 件
- 講評(Fable): 冒頭で意思決定者(行政の支援策評価・設計)を明示し、各論点を「支援を一律にするか狙い撃ちするか」「拡大か定着・質向上か」「費用助成は起爆剤か質向上向けか」と選択肢の形で提示、末尾で優先順位仮説まで示している。5階層17項目と幅は広いが、いずれも政策判断に接続しており根拠は図表番号で対応、数値も原典と一致する。
- 講評(Astra): 行政の支援策設計という意思決定主体を明示し、支援対象、拡大と定着の配分、労務管理対策を階層的に整理して根拠を対応させている。優先順位を仮説として提示し、KPIとの定義整合の確認も留保しているため、政策検討の材料として使える。
回答の全文を読む
テレワーク実態調査報告書の論点構造化
前提:本書は有効回答7,982件(回収率39.9%)、ウェイトバック集計のアンケートと15社ヒアリングに基づく(Ⅰ-2)。以下、行政による支援策の評価・設計を主たる意思決定と想定しつつ、企業の制度設計にも転用可能な形で重要論点のみ階層化した。
1. 導入状況の評価と政策の焦点づけ
1-1. 政府KPIとの乖離の評価
- 在宅勤務を「制度として認めている」企業は11.9%(慣習的実施を含め約23%)で、政府KPIの導入率55.2%に対し低水準(Ⅰ-1、Ⅱ-2-(2)①図表11)
- ただしKPIの「導入率」の定義と本調査の回答区分の整合確認が前提(Ⅱ-2-(2)①)
1-2. 規模・業種格差が支援対象の焦点を規定
- 制度化率は1,000人以上67.1%に対し29人以下8.4%(図表12)、業種では情報通信業60.0%に対し医療・福祉5.0%(図表13)
- → 支援を一律とするか、中小・特定業種に狙い撃ちするかの判断材料
1-3. 政策の主眼は「拡大」か「定着・質の向上」か
- 実施割合は「1割以下」が63.7%(図表62)、継続意向は「現状維持」48.7%に対し「拡大」8.6%(図表63)
- → 限定的利用の維持が多数派であり、導入拡大から運用の質向上へ主眼を移すべきかの論点
2. 導入拡大策の有効性判断
2-1. 業務特性という構造的制約
- 未導入理由の59.1%が「テレワークでできる業務が限られている」(図表18)、可能になる条件を問うと70.3%が「余地は考えられない」(図表22)
- 対面・現場業務主体の業種(建設・運輸・宿泊・医療福祉)への介入余地は小さい(図表20)
2-2. 未導入企業には需要自体がない
- 94.6%が「導入予定なし」(図表24)、検討契機「特になし」が52.5%(図表26)
- 要望1位の「費用助成」(31.8%)は実施企業の要望が高い(44.0%対 非実施27.8%、図表66)ため、新規導入の起爆剤ではなく既存企業の質向上向けに機能する可能性
2-3. 廃止企業への対応方針
- 再開予定なし88.4%(図表25)。廃止理由は業務制約56.2%に加え「不公平感」31.1%(図表21)
- 廃止企業は支援要望が高く(図表67)、好事例による不公平感対策の提示先として重点層になりうる
3. 労務管理の空白=最優先のリスク対応領域
3-1. ガイドライン未浸透:認知は全体18.5%、制度化企業でも38.0%(図表8~10)
3-2. 労働時間管理の脆弱性
- 勤怠管理はメール報告35.6%、自己申告記入30.5%が主流(図表36)。適正化措置「特になし」が17.5%(図表42)、中抜けの扱い「特に決まっていない」37.4%(図表41)
3-3. 残業・深夜・休日労働のルール不備
- 深夜労働は41.9%が「認めていない」一方、割増賃金は事後報告ベースが74%(図表43・45)。実態との乖離(申告なき残業)の懸念。客観的確認手段(PCログ等)は31.8%にとどまる(図表44)
3-4. 安全配慮の空白
- 健康確保措置「特になし」70.3%(図表52)、作業環境確認「いずれも未確認」81.0%(図表55)、労使協議の場「なし」58.7%(図表56)
- → 2.の拡大策に優先し、法遵守・安全配慮の周知指導を最重点とすべきという論点
4. 導入目的・効果の構造変化と政策メッセージ
4-1. 目的の転換:首位目的がR2のBCP(61.3%)から「育児介護両立・離職防止」(50.3%)へ(図表57)。人手不足企業64.6%(図表4)という状況下、「人材確保・採用アピール」軸への訴求更新が需要喚起に接続する
4-2. 課題の縮小・定着:「特に課題なし」2.9%→13.4%、主要課題は軒並み低下(図表60)。コロナ禍の緊急導入から定着フェーズへ移行
4-3. 効果の規模依存:両立・離職防止等の効果認知は規模が大きいほど高い(図表58数値表)。中小が効果を享受しづらい構造
4-4. 不公平感の認知ギャップ:「人事評価に違いなし」77.2%(図表53)と回答される一方、未導入・廃止理由には不公平感が定着。回答と実感の乖離を踏まえた設計が必要
5. 支援策の内容設計への示唆(ヒアリング15社)
- 5-1. 経営層の関与と意図説明の徹底(A・C・M社:社長主導、導入目的の粘り強い説明)
- 5-2. デジタル化・業務設計との一体化:業務の棚卸し・切り出しが成否を分ける(B・J・N・O社)
- 5-3. 不公平感対策の具体手法:現場社員への「リスペクト」周知(J社)、規定化と手当(M社)、座談会(N社)
- 5-4. 継続課題:新人育成・IT担い手不足・セキュリティ対応(G・F・E・O社)
- → 「制度導入への支援」21.0%、「好事例の情報提供」18.3%、「専門家派遣」9.1%(図表65)の中身を、上記成功条件に沿って設計する論点
総括(優先順位の仮説)
- 最優先は3.の労務管理の空白(法遵守・安全配慮は現行運用のリスクであり、ガイドライン認知向上が低コスト)
- 次いで1-3・4.に基づき、政策の主眼を「導入拡大」から「限定的運用の質向上+人材確保価値の訴求」へ移す判断
- 拡大支援は2-1の構造制約を踏まえ、業務の切り出し可能性が高い層に的絞りとし、廃止企業へのアプローチを併行させる
資料B(テレワーク 総合実態調査 報告書)|q2 欠けている情報
96GB 実機・Qwen3.8-27B(重み 8bit・作業メモリ 16bit=96GB の最良設定)
- 品質: Fable 3 / Astra 3
- 気づいた弱点: TB7 「実際に生じた効果」が自己申告である(両名)
- 事実誤り: Fable 0 件 / Astra 1 件
- 講評(Fable): 6項目とも資料の数値(70.3%、13.9%/15.6%、29.3%、31.8%、18.6%)とヒアリング事例(D社・G社・M社)を根拠に欠落を特定し、経営判断と行政判断の両面で「下せない判断」を具体化している。「導入目的」「実際に生じた効果」が企業側の主観的評価(複数選択式)であることを明示した点も良い。項目3(セキュリティ事故実態)はやや周辺的で、対応させた判断(特定業種への適用制限)にも無理があるが、全体としてそのまま使える水準。
- 講評(Astra): 成果、健康、セキュリティ、従業員への影響、総費用と便益などの重要な不足を、投資・支援・労務管理の具体的判断と対応させている。企業の認識や個別事例からは判断できない定量的な影響を明確にしており、追加調査の検討材料になる。
回答の全文を読む
意思決定を阻む資料の欠落事項
1. 生産性・業務成果の客観的定量データ
何が書かれていないか:
本調査は「導入目的」や「実際に生じた効果」を企業側の主観的評価(複数選択式)で集計しているが、テレワーク前後の1人当たり生産性、業務処理時間、エラー率、顧客満足度、売上高など、客観的に測定可能な成果指標は一切含まれていない。「定常的業務の効率・生産性の向上」を目的・効果として回答した企業は存在するが、それが何%向上したのか、あるいは低下したのかの裏付け数値がない。
どの判断が下せないか:
「テレワークを全社・全職種に拡大すべきか、現状維持か、縮小すべきか」という経営判断、および行政が「テレワーク導入率の政府KPI(全国55.2%)をさらに引き上げるべきか」を判断する根拠が欠落する。主観的満足度だけで拡大を推進すると、生産性低下を伴う導入が量産されるリスクを排除できない。
2. テレワーク中の労働災害・健康障害の実態データ
何が書かれていないか:
「労働災害の認定基準が分かりづらい」を未導入理由・課題として回答した企業は存在するが、令和2年度以降にテレワーク中に実際に発生した労災(腰痛、転倒、メンタル不調による休職等)の件数、認定率、補償額、あるいは「認定されなかった事例」の数は一切記載されていない。健康確保措置として「特に行っていない」が70.3%と回答されているが、その結果として実際にどのような健康被害が起きているかのデータがない。
どの判断が下せないか:
「テレワーク中の労災認定基準を明確化・緩和すべきか」「安全配慮義務の範囲を法整備で定めるべきか」という法制度上の判断が下せない。また、企業側としては「テレワーク中の健康障害リスクをどの程度保険・補償でカバーすべきか」のリスク管理判断もできない。
3. 情報セキュリティ事故の実態データ
何が書かれていないか:
「情報セキュリティの確保が難しい」を未導入理由(13.9%)や課題(15.6%)として回答した企業は存在するが、テレワーク導入後に実際に発生した情報漏洩、不正アクセス、データ紛失等の事故件数、被害額、原因の内訳が記載されていない。ヒアリング事例でD社の「社外秘書類を持ち出した社員」の事例が1件あるのみで、統計的実態が把握できない。
どの判断が下せないか:
「テレワーク時のセキュリティ基準をどの程度厳格化すべきか」「特定業種(金融、医療、防衛関連)へのテレワーク適用を制限すべきか」という規制設計の判断が下せない。また、企業としては「テレワーク環境への投資をどこまで行うべきか」の投資判断も根拠が薄い。
4. 従業員個別の満足度・離職率・評価の定量データ
何が書かれていないか:
本調査はすべて「企業(経営者・人事担当者)が回答する」設計であり、テレワーク実施者本人の満足度、ストレスレベル、離職意向、あるいはテレワーク可否による離職率の差、人事評価への実際の影響(昇給率、昇格率の差)などの従業員側データが一切ない。「不公平感がある」を課題と回答した企業は29.3%いるが、それが実際に離職やモチベーション低下にどの程度つながっているかのデータがない。
どの判断が下せないか:
「テレワーク制度の継続が人材確保・定着に本当に寄与しているか」を因果関係で判断できない。行政が「多様な働き方支援策」の優先順位を付ける際、離職防止効果の大きさを定量比較できず、助成金の配分判断が主観に依存する。
5. 費用対効果(総コスト・総便益)の定量データ
何が書かれていないか:
「テレワーク導入のための費用の助成」を行政支援として求める企業が31.8%いるが、実際に企業がテレワーク導入・運用にかけた総コスト(機器、通信、ツール、人件費、オフィス維持費)と、得られた総便益(通勤手当削減、オフィス賃料削減、人件費削減、生産性向上の貨幣換算)の比較データがない。「コスト削減」を効果と回答した企業は少数であり、G社の「コストは増大している」という指摘もあるが、業種・規模別の平均コスト構造が示されていない。
どの判断が下せないか:
「テレワーク導入助成金の対象範囲・金額をどう設計すべきか」「中小企業(29人以下)と大企業(1,000人以上)で支援の優先順位をどう付けるか」という財政判断が下せない。便益がコストを下回る業種・規模に一律助成を行うと、公金の非効率な配分になるリスクを排除できない。
6. 非テレワーク従業員の業務負荷増の定量データ
何が書かれていないか:
「オフィスで勤務する従業員へのしわ寄せが生じている」を課題と回答した企業は18.6%あるが、そのしわ寄せが具体的に何時間分の残業増、何件の業務追加、あるいは離職にどの程度つながっているかの定量データがない。D社やM社のヒアリングで「出社組がサポートを担う」「製造ラインは有給しか取れない」という記述はあるが、体系的な実態把握がされていない。
どの判断が下せないか:
「テレワーク拡大に伴う非対象者への補償・救済措置(有給増、手当、業務再配分)を制度として義務付けるべきか」という労務管理上の判断が下せない。また、労使交渉において「公平性の確保」をどう具体化するかについて、双方が合意できる基準値を提示できない。
以上、本資料は「どの企業がどのような制度を設けているか」の横断的実態把握としては充実しているが、「その制度が実際にどのような結果を生み、どの程度のコストで、どの程度の便益を上げているか」という因果・定量の層が欠落している。政策設計や経営判断の最終段階では、この6項目のデータが不可欠である。
GLM-5.3-Flash(クラウド fp8・256GB 級の代わり)
- 品質: Fable 3 / Astra 3
- 気づいた弱点: TB2 経年比較で選択肢が変わっている(両名) / TB4 「導入」の定義の緩さ または 実施率1割以下が63.7%(両名) / TB5 冒頭のKPIが地域別なのに、導入状況の地域別集計がない(両名) / TB6 回収率39.9%=6割が未回答であることと、非回答バイアスへの言及がない(両名) / TB7 「実際に生じた効果」が自己申告である(両名)
- 事実誤り: Fable 0 件 / Astra 1 件
- 講評(Fable): 導入率とKPIの定義不整合・地域別集計の欠如、回収率39.9%の非回答バイアス、経年比較の選択肢変更、実施割合「1割以下」63.7%など、資料自身の判断限界を具体的な図表・数値に紐づけて対にし、結びで優先順位(1・2は政策評価の可否、3・4は法令遵守、6・9は支援策設計)も付けている。10項目はやや多いが、各項目が資料の記述に根拠づけられており、そのまま政策評価の留意点として使える。
- 講評(Astra): 代表性、地域別KPI、実利用、労働時間の実測などの不足を、資料の数値や事例と対応させて具体的な判断限界に落としている。論点は多いが、末尾で優先課題を指定しており、追加調査や政策検討の材料として使える。
回答の全文を読む
本報告書に「書かれていないこと」と「下せない判断」の対
本書は導入率や労務管理の現状値を幅広く示す一方、①数値の信頼性の根拠、②政策目標との突合、③法令適合性の検証、④費用対効果、⑤当事者である労働者側の視点、が欠落している。以下、重要なものに絞って示す。
1. 非回答バイアスと標本誤差の検証
- 書かれていないこと:業種・規模別の回収率、回答企業と非回答企業の属性差、推定値の信頼区間・有意性検定。有効回答率39.9%の内実が不明。
- 下せない判断:テレワークに関心のない企業ほど回答を避けた可能性がある中で、「制度として認めている11.9%」等の水準を全国値としてどこまで信頼できるか。また令和2年度からの増分(+4.4ポイント)が実質的変化か、標本誤差や選択肢変更(※印の選択肢見直し)による見かけの変化かの判別。
2. 政府KPIとの定義整合と地域別集計
- 書かれていないこと:本調査の導入率(制度11.9%+慣行11.0%=約23%)とデジタル重点計画のKPI(全国55.2%)の定義の違い(企業ベースか労働者ベースか、頻度要件の有無)の説明。調査目的で「地方の遅れ」を掲げながら、本編に地域別の導入率クロス集計がない。
- 下せない判断:政府目標に対する達成進捗の評価、および地方向け支援の優先順位付け。
3. 労働時間の実測と申告の正確性
- 書かれていないこと:自己申告とPCログ等の突合による乖離の実測、申告漏れ・隠れ残業の発生率。企業の「テレワーク時の方が残業は少ない」(合計49.5%)という主観と実態の差。中抜け・時差勤務・海外対応で「飛び飛びの労働時間」になる実態(ヒアリングD社が課題と指摘)の定量値。
- 下せない判断:割増賃金未払いリスクの規模評価、労働時間把握義務の遵守実効性の検証、監督指導強化の要否。
4. 休憩・中抜け「未定」企業の法令適合性評価
- 書かれていないこと:休憩時間を「特に決まっていない」が23.6%、中抜けの取扱いを「特に決まっていない」が37.4%あることの法的評価(労基法上の問題性の整理)。
- 下せない判断:就業規則・テレワーク規定の整備を重点指導すべきか、ガイドライン周知で足りるかの判断。
5. 「実施割合」の定義と実態
- 書かれていないこと:図表62の「実施割合」の分母・分子(対象労働者の何割か、月何日か)、「1割以下」63.7%の内訳(ほぼゼロの企業を含むか)。
- 下せない判断:「制度はあるが使われていない」企業の規模の把握。導入促進策と利用促進策のどちらに資源を振るべきかの判断。
6. 導入・運用コストと費用対効果の定量値
- 書かれていないこと:機器・システム・手当の支出額、生産性・離職率・売上等の客観指標との関連分析。効果はすべて主観選択(「効果があった」%)であり、人手不足を感じる企業64.6%とテレワーク導入のクロス分析も本編にない。
- 下せない判断:行政要望1位が「費用の助成」(31.8%)であるにもかかわらず、必要な助成額の水準と、助成が導入率を何ポイント押し上げるかという費用対効果の評価。中小企業が「少人数のために費用をかけられない」と述べる規模感の把握。
7. 労働者側データの不在
- 書かれていないこと:従業員への直接調査。不公平感・孤独感・自宅作業環境・家庭内での労働実態は、すべて企業の認識経由でのみ把握。
- 下せない判断:健康確保措置を「特に行っていない」が70.3%であることが問題か否かの検証、労働者向け相談窓口・啓発の必要性、テレワークが実際に両立支援として機能しているかの評価。
8. 廃止・失敗事例の深掘り不足
- 書かれていないこと:廃止企業(n=391)の個別事例、廃止後の従業員の処遇、再開検討企業(100~299人で約4割)の具体的条件。ヒアリングは「好事例となりうる企業」の選定が明示され、失敗の類型化は末尾3行程度。
- 下せない判断:再開を促す支援の設計(何を提供すれば廃止企業が動くか)、同種の失敗を防ぐ注意点の提示。
9. 公的支援の利用率と効果検証
- 書かれていないこと:アンケートに助成金等の利用状況の設問がなく、ヒアリングの一部企業(B社・I社・J社・N社等)が活用に言及するのみ。
- 下せない判断:既存支援が導入決定に実際に寄与したかの評価、支援事業の継続・拡充・縮小の判断。
10. 人事評価の「制度上の回答」と実運用の乖離
- 書かれていないこと:「評価に違いはない」77.2%は制度の有無を問う設問であり、考課結果の分布や昇進・昇給の実績差のデータがない。ヒアリングでは「対面でないことによる心理的バイアス」への懸念(D社)や管理職の指導事例(M社)が示されるのみ。
- 下せない判断:テレワーク従業員の処遇が実質的に不利になっていないかの検証、評価者研修等の対策の要否。
結び:優先順位としては、1・2は「本調査を政策評価に使えるか」を左右し、3・4は法令遵守の観点で、6・9は支援策設計の観点で不可欠である。逆にヒアリング事例は質的に充実しているが、あくまで成功企業の選定事例であり、「成功要因」ではなく「検証されていない主張」として読み分ける必要がある。
資料B(テレワーク 総合実態調査 報告書)|q3 反対仮説
96GB 実機・Qwen3.8-27B(重み 8bit・作業メモリ 16bit=96GB の最良設定)
- 品質: Fable 3 / Astra 2
- 気づいた弱点: TB3 経年比較の分母集団の構成が変わっている(両名)
- 事実誤り: Fable 1 件 / Astra 1 件
- 講評(Fable): 自己申告・経年比較・本社回答の3前提に絞り、前提/反対仮説/検証事実が区別され対応している。検証事実は標本数・対象・判定閾値まで具体的(20社×各3名以上、300人以上10社・一致率50%)。前提2の検証は仮説(a)形式化のみを検証し(b)母集団構成は検証しない点が惜しいが、「事実を1つ」の要求には応えている。
- 講評(Astra): 重要な3点について、前提/反対仮説/検証事実の区別があり、企業回答と従業員・拠点回答を照合する提案は具体的である。ただし、現存するコロナ期導入企業の規定改訂を調べるだけでは経年間の回答集団の違いを検証できず、本社回答の一致率50%という判定基準にも根拠がない。
回答の全文を読む
本報告書が暗黙に依拠する前提を、重要性の高い順に3つ特定し、それぞれについて反対仮説と検証事実を提示する。
前提1:回答企業の自己申告が実態を正確に反映している
本調査は企業へのアンケートにより、テレワークの導入状況・労務管理の実態を把握している。この手法は、企業が自社の制度や運用を正確かつ完全に申告するという前提に立っている。特に、勤怠管理方法(問14)、自己申告による労働時間把握のための措置(問15)、法定時間外労働のルール(問16)など、労務管理の「実効性」に関わる項目では、制度上の規定と実際の運用に乖離がある場合、企業は「制度上はこうなっている」と回答する可能性が高い。
反対仮説: 企業が申告する労務管理の実態と、従業員が実際に経験している管理の実態には系統的な乖離が存在し、特に中小企業(29人以下が回答の70.7%を占める)では、制度の「存在」と「機能」の間に大きな隔たりがある。
検証事実: 自己申告制の勤怠管理を採用していると回答した企業(全体で30.5%)から無作為に20社を抽出し、従業員(各社3名以上)に「申告の頻度、申告内容が実態と一致しているか、申告を怠った場合の会社側の対応」を匿名で調査し、企業側の申告と照合する。
前提2:令和2年度調査との経年比較が「質的な変化」を意味している
本報告書は令和2年度(2020年)調査との比較を随所で行い、「在宅勤務の制度としての認容が4.4ポイント増加」「課題の割合が低下した」等と解釈している。この比較が有効であるためには、両調査の回答母集団が同質であり、設問の意図が等しく理解されていたことが前提となる。しかし、令和2年度調査はコロナ禍の最中に実施され、回答企業は「緊急対応中」の企業が多く、令和7年度調査は5類移行後の「平常時」に実施されている。
反対仮説: 経年比較でみられる「課題の減少」や「制度の定着」は、テレワークの質的改善というより、(a) コロナ禍中に緊急導入した企業が一時的な運用を「制度」として形式化したこと、(b) 令和2年度調査の回答母集団にコロナ禍でテレワークを余儀なくされた企業が多く含まれていたこと、に起因する測定アーティファクトである。
検証事実: 令和7年度調査で「2020年4月~2023年4月に導入」と回答した企業(68.4%)について、導入当初の就業規則・テレワーク規定の原文と現在のものを比較し、改訂履歴を調査する。改訂が「形式の整備」にとどまり、運用実態(利用頻度、対象者範囲)が導入当初とほぼ変わらない場合、上記仮説が支持される。
前提3:企業単位での回答が実態を代表している
本調査は「会社全体として回答いただくこととし、拠点ごとに異なる等の場合は本社の状況を回答いただいた」と明記している。この設計は、同一企業内でのテレワーク運用が均質である、あるいは本社が代表値であるという前提を含む。
反対仮説: 同一企業内において、部署・職種・拠点ごとにテレワークの可否・頻度・管理方法が大幅に異なり、企業単位の回答は実態を代表しない。ヒアリング事例(D社、H社、M社等)にも見られる「制度上は全員対象だが実質は間接業務のみ」のような乖離が普遍的である場合、アンケートの「導入率」は実態を過大評価している。
検証事実: 回答企業のうち従業員300人以上の企業から無作為に10社を抽出し、本社だけでなく各拠点・部署の責任者にも同様の設問(テレワークの可否、利用頻度、勤怠管理方法)を回答させ、本社回答との一致率を算出する。一致率が50%未満であれば、企業単位回答の代表性に重大な問題がある。
GLM-5.3-Flash(クラウド fp8・256GB 級の代わり)
- 品質: Fable 3 / Astra 2
- 気づいた弱点: TB2 経年比較で選択肢が変わっている(両名) / TB3 経年比較の分母集団の構成が変わっている(両名) / TB4 「導入」の定義の緩さ または 実施率1割以下が63.7%(両名) / TB6 回収率39.9%=6割が未回答であることと、非回答バイアスへの言及がない(Fable) / TB8 実施企業と非実施企業の差が自己選択による群である(両名)
- 事実誤り: Fable 1 件 / Astra 1 件
- 講評(Fable): 5前提とも前提/反対仮説/検証事実が明確に区別・対応し、39.9%・63.7%・n=3,762・選択肢変更・廃止391社など資料の根拠に精確に接続している。検証事実は業種別回収率のばらつき、同一企業パネル、ヒアリング15社のプロファイルを母集団分布に照らす等、既存データの二次分析で着手できるものが多く、そのまま判断材料に使える。前提5(ヒアリング事例の選定バイアス)は他にない視点。長さでは加点していない。
- 講評(Astra): 前提/反対仮説/検証事実を区別し、利用の薄さ、経年比較、事例選定などを資料の具体例と結び付けている。ただし、業種別回答率の差だけではウェイトバック後にも残る偏りを検証できず、同一企業の導入前後比較だけで因果効果を自己選択から切り分けられるとする説明にも修正が必要。
回答の全文を読む
本資料の暗黙の前提と反対仮説の検討
はじめに
本報告書は厚生労働省委託事業として、テレワークの導入状況と労務管理の実態を大規模なアンケート(有効回答7,982社)とヒアリングで明らかにしている。一見中立的な実態調査に見えるが、調査設計・分析・記述の背後には複数の暗黙の前提が存在する。以下、資料全体の解釈や政策含意に影響を与える重要な前提を5つに絞り、それぞれの反対仮説と検証に必要な事実を提示する。
前提1:「回答企業は日本企業全体の縮図である」
前提の内容
本調査は20,000社に郵送配布し、経済センサスに基づくウェイトバック集計を行い、母集団への代表性を確保しようとしている。この設計自体、回答企業の性質が無回答企業と同質であるという暗黙の前提を置いている。
前提が崩れる場合の反対仮説
テレワークに関心のある企業(導入企業、導入を検討していた企業)ほど回答しやすいという無回答バイアスが存在し、結果としてテレワーク導入率・実施割合が過大評価されている。特に39.9%という回答率は、6割の企業が答えていない状況であり、郵送+オンライン回収という方式は、事務管理部門が整備された大企業・ホワイトカラー企業に有利に働く。仮にこの仮説が正しければ、「導入率の増加(在宅勤務の制度化が7.5%→11.9%)」の一部は、母集団の実態ではなく回答者層の変化を反映している可能性がある。
検証すべき事実
過去の同種調査(令和2年度調査を含む)における「回答企業と非回答企業の属性差」を、経済センサスの母集団構成と比較すること。具体的には、業種別・規模別の回答率のばらつき(例:情報通信業の回答率が建設業より高いか)を確認する。仮に特定業種で回答率が突出して高ければ、ウェイトバックでも是正できない選択バイアスの存在が示唆される。
前提2:「経営者・人事担当者の回答は企業の実態を反映している」
前提の内容
本調査は「会社全体として回答いただくこと」としており、回答者は経営層または人事・労務担当者と想定される。その自己申告に基づく数値(「人事評価に違いはない」77.2%、「健康確保の措置は特に行っていない=オフィスと同様」70.3%等)が、企業の実際の運用・労働者の実感と一致するという前提を置いている。
前提が崩れる場合の反対仮説
経営側の回答は「理想像・建前」を反映しており、労働者の実感とは乖離している。とりわけ評価や健康管理に関する回答は、制度上の差異の有無を問う設問であり、運用上の実質的な差別(在宅勤務者の評価が低くなる等、ヒアリングのD社が懸念を表明している現象)や、実は不十分な健康配慮が「あるように」回答されている可能性がある。調査主体が厚生労働省であることも、法令順守を意識した「望ましい回答」への誘導を強めうる。
検証すべき事実
同一企業の労働者側に対する実施調査(例:労働者アンケート)で、「人事評価の公平性の実感」「テレワーク中の健康配慮の実感」を企業側回答と照合すること。テレワーク実施者の自己申告労働時間と客観的データ(PCログ等)の乖離幅を測ることも、労務管理の「実態把握」が機能しているかを直接検証できる。乖離が大きい企業ほど、経営側回答の信頼性が低いと判断できる。
前提3:「テレワークは雇用の安定・両立支援に資する『推進すべき』働き方である」
前提の内容
調査目的の冒頭で「テレワークは柔軟な働き方を可能とする…雇用の安定・継続にも資する」と位置づけ、政府KPI(導入率55.2%)の達成を意識した設計となっている。テレワークの価値が肯定的に前提され、調査は「導入・定着を進めるための基礎資料」を目指している。
前提が崩れる場合の反対仮説
テレワークの拡大は、必ずしも労働者福祉の向上に結びつかず、長時間労働の潜在化・教育機会の喪失・孤独・監視強化など負の側面を増幅させる。資料自体、廃止理由で「不公平感」31.1%を示すほか、ヒアリングのE社(品質問題の発覚遅延・ブラックボックス化)、G社(個人主義の進行)など反証が内包されている。また導入率KPIは「制度の有無」を測るもので、実施割合(「1割以下」が63.7%)や質を反映しない。仮にこの仮説が正しければ、導入率目標の達成は実質的な働き方の改善と無関係でありうる。
検証すべき事実
テレワーク導入企業と非導入企業を比較した際の、労働者の客観的成果指標(離職率、残業時間の実態、新入社員の育成到達度、メンタルヘルス不調の発生率)の差を、縦断データで確認すること。特に「制度導入の前後」で同企業内のこれら指標がどう変化したかを見れば、テレワーク自体の因果効果を、導入企業の自己選択(良い職場ほど導入する)と切り分けられる。
前提4:「令和2年度との比較は時系列変化を測っている」
前提の内容
資料は令和2年度調査との比較を随所で行い、「制度化が4.4ポイント増加」「課題認識が低下」等を時系列変化として記述している。両調査で同じ測定対象・同じ母集団が保たれているという前提を置いている。
前提が崩れる場合の反対仮説
令和2年度(コロナ禍の緊急調査)と令和7年度は、調査対象の抽出方法・回答者層・設問文が異なり、比較可能な時系列データではない。実際、本書の記述から、令和2年度調査は抽出母集団・回答数(n=3,762 vs 7,982)が大きく異なり、設問の選択肢変更(「評価が難しい」→「評価・育成が難しい」等)も明記されている。「コロナ禍の緊急導入企業」の縮退(導入時期分析で68.4%がコロナ期導入とされる)と「制度定着」が混同され、「テレワークは緊急措置から定着した」という物語が、実はコロナ期導入企業の制度縮小(週2日制限等、G社・I社の事例)と表裏一体の可能性がある。
検証すべき事実
令和2年度調査の回答企業のうち令和7年度調査にも回答した同一企業のパネルデータを抽出し、同一企業内での導入状況・実施日数・制度化の変化を追跡すること。クロスセクション比較ではなくパネル比較で初めて「定着したのか、縮小したのか」が判別できる。また「課題の低下」が課題の解決なのか、課題を感じる企業が脱落しただけなのかも区別できる。
前提5:「ヒアリング事例は導入企業の代表例・模範例として参照に値する」
前提の内容
ヒアリング調査は「積極的に活用している企業を主な対象」とし、公表情報から好事例を選定した15社を掲載している。これらの成功事例が他社の導入・定着の参考として一般化できるという前提を置いている。
前提が崩れる場合の反対仮説
ヒアリング対象は生き残りバイアスと成功バイアスを強く含む。フルリモートを定着させたE社・C社は、校正・SES等「個人で完結する業務」の業種・規模(10〜29人)に偏り、経営者の強いリーダーシップ(A・J・L社)や社長の個人的な価値観(M・I社)に依存する事例が多い。こうした条件は一般企業では再現不可能であり、事例を「好事例の情報提供」(行政支援策の第3位)として発信しても、ノウハウの移植可能性は低い。むしろ制度を縮小・限定運用に転じたD社(原則出社化)の方が、一般的な軌道かもしれない。
検証すべき事実
アンケート母集団(7,982社)において、ヒアリング15社と同等のプロファイル(規模・業種・導入形態)を持つ企業群の実施割合・継続意向・廃止率の分布を確認すること。ヒアリング企業の「浸透度8〜10割」が母集団の同種企業の分布内で上位何%に位置するかを測れば、事例の典型性が検証できる。同時に、導入後に制度化・規模縮小・廃止へ転じた企業の割合(廃止企業391社の経歴分析)を確認すれば、「成功の条件」か「生存の条件」かを区別できる。
おわりに
5つの前提は共通して、「測定の容易なもの(制度化の有無、経営者の自己評価、成功事例)が、測定困難な実態(労働者の経験、運用の質、失敗事例)の代理になる」という点で連動している。資料は賃金・労務管理の制度面で有用な情報を多く提供するが、上記の前提が崩れた場合、「テレワークの着実な定着」という報告書全体のトーンは、「制度化されたが薄く運用される働き方の定着」へと読み替えられるべき可能性がある。各反対仮説の検証事実は、既存データの二次分析(パネル化、層別回答率確認)で着手可能なものから順次、労働者側データの収集へと拡張することが望ましい。
6. 示唆
- ローカルLLMの用途を分けて考える
- 資料の下読み、要約、事実の抜き出し、論点の整理 → 96GB 級でも、手直し前提なら使える。速度も実用的
- 資料の弱点・根拠の甘さを指摘する批判的な読み → 96GB 級では届かない。大きいモデルが要る
- 「圧縮した状態」で評価する
- モデルの評判やクラウドでの評価は、圧縮していない(または軽い圧縮の)状態の成績。手元では、同じモデルでも弱点への到達が 1/4 程度まで落ちた
- 大きいモデルほど、手元のメモリに載せるために強く圧縮する必要がある。例: GLM-5.3-Flash は 4bit でも 177.5GB で、256GB の機械では 8bit にできない
- → 購入前・導入直後に、自社の実務に近い資料と問いで、実機で測る
- 設定を既定のままにしない
- Ollama の既定(作業メモリ 8bit)より、作業メモリを 16bit にした方が弱点への到達が戻った。読み込みの時間は変わらない
- メモリに余裕がある場合は、重みも 8bit 版を選ぶ
- 「考える量を増やせば賢くなる」とは限らない
- 最大にしても弱点への到達は増えず、答えが出ない問いもあった
- 採点は複数の軸で
- 品質の点だけ見ると、弱点を見抜く力の差が見えない。事実誤りも品質とは別に数える必要がある
7. この検証で言えないこと
- 規模が小さい: 資料2本・設問3種。1〜2判定の差は、ばらつきの範囲として読まない。本書で主張しているのは差が大きい部分(到達 9 対 36 など)だけ
- 256GB 級は実機で測っていない: GLM-5.3-Flash の数字はクラウド(fp8)での代用。手元で 4bit にすると下がる見込みが強い(Qwen では 13〜14 → 3〜7)。どこまで下がるかは未測定
- タスクは長文読解だけ。コード、議事録の要約などは測っていない
- 採点者は AI。弱点リストの作成にも AI(Claude)を使っている(人が原典と照合して確定)。絶対的な水準は採点者によって変わる(①では Fable が Astra より一貫して甘かった)。比較の向きは2名で一致している
- 実行環境は Ollama(GGUF)のみ。MLX など別の実行環境では結果が変わりうる
- 温度0で1回ずつの生成。条件を変えても出力が一字一句同じになった問いが1つあった(作業メモリの精度を変えても、選ばれる語が変わらなかった)
付録
A. 生成条件
| 実機 | クラウド | |
|---|---|---|
| 実行 | Ollama 0.34.3(Mac Studio M5 Ultra 96GB・macOS 27.0) | OpenRouter(fp8 を指定) |
| 温度 | 0 | 0 |
| 出力上限 | 16,000 トークン(思考を含む) | 16,000 トークン |
| 文脈長 | 131,072 | 提供側の上限 |
| 思考の量 | 既定(§5-1 のみ最大) | 提供側の既定 |
| 渡し方 | 設問 → 区切り線 → 資料の全文(1通のメッセージ) | 同じ |
B. 費用と時間
- クラウド比較(87本)の生成費用: 約6米ドル(採点分は別)【当方の実績値・2026-09-16】
- 実機の6問: 約35分(1問 約5〜6分)
- 採点: 1回(6問×5本×2名)あたり約10分
C. 速度の全記録(実機・6問)
| 条件 | 読み込み: 資料A(約10.2万トークン) | 読み込み: 資料B(約9.3万トークン) | 最初の1文字まで | 生成(tok/s) | 出力トークン(思考込み) |
|---|---|---|---|---|---|
| 重み 4bit・作業メモリ 8bit | 226.6〜227.7秒(447〜450 tok/s) | 195.7〜198.1秒(470〜476) | 196〜230秒 | 18.6〜25.1 | 2,035〜3,811 |
| 重み 4bit・作業メモリ 16bit | 225.7〜227.2秒(448〜451) | 195.7〜196.1秒(475〜476) | 196〜231秒 | 20.7〜30.5 | 2,074〜4,466 |
| 重み 8bit・作業メモリ 8bit | 225.1〜228.4秒(446〜453) | 196.4〜197.8秒(471〜474) | 197〜232秒 | 18.7〜19.4 | 1,871〜3,252 |
| 重み 8bit・作業メモリ 16bit | 224.5〜224.9秒(453〜454) | 195.0〜197.7秒(471〜477) | 196〜228秒 | 24.0〜24.7 | 2,352〜3,512 |
| 重み 4bit・作業メモリ 8bit・思考を最大 | 225.8〜226.0秒(451) | 195.6〜196.0秒(475〜476) | 196〜229秒 | 24.2〜26.4 | 3,391〜32,000 |
- 読み込み済みの再利用: 資料 → 設問1 → 設問2 を同じ会話で送ると、2問目は入力 103,223 トークンのうち差分だけを処理し、読み込み 5.2秒・最初の1文字まで 5.4秒だった
- 全回答(本文・生成条件・速度・採点記録)は付属資料「ローカルLLM検証の生回答」に載せた
D. 用語
- 量子化(圧縮): モデルの数値の精度を落として小さくすること。16bit → 8bit で約半分、4bit で約1/4 の大きさになる
- 重み: モデル本体の数値
- 作業メモリ(KV キャッシュ): 読んだ内容を覚えておくための領域。長い資料ほど大きくなる
- fp8: クラウドの提供側がよく使う 8bit の形式
E. 全回答(119本)
本検証で生成した全回答(119本)を、生成条件・速度・採点記録とあわせて公開している。資料・設問・モデルで絞り込んで読める。
