事例実践事例 / 公開物 / case
第9章 正しさ・出典・回答拒否から、QAの利用可否を評価する
構築したQAを、正しさ・出典・一貫性・耐誘導性などの観点で評価する。誤情報、粒度、根拠不足、推測による回答を見つけ、改善対象を明確にする。
2026年3月更新履歴
読む目的: 自然言語サービス・RAG・ナレッジ / AI × ソフトウェア開発 / 事例・実務
このBookの目次(全12章)
- 全体構成
- 第1章 仕様を答えられない状態から、復元すべき情報を決める
- 第2章 対象システムの変更を妨げる構造と知識の不足を整理する
- 第3章 調査の起点を作るため、ファイルとクラスの役割を整理する
- 第4章 コードから仕様と依存関係を復元する
- 第5章 処理の流れを復元し、変更影響を追えるようにする
- 第6章 人が読む仕様とAIが使うKnowledgeを分ける
- 第7章 UI操作と内部処理を結び付け、操作結果を追えるようにする
- 第8章 復元したKnowledgeを、根拠を確認できるQAへつなぐ
- 第9章 正しさ・出典・回答拒否から、QAの利用可否を評価する
- 第10章 評価結果をKnowledgeと回答範囲の改善へ戻す
- 第11章 仕様変更に追従できるKnowledge更新フローを作る
- 第12章 QAで暗号処理を調査し、人間の変更判断へつなぐ
現在位置:第9章・全12章
誤った回答が、変更や設定の根拠にならないか
QAが回答できても、その内容を仕様確認に使えるとは限らない。誤答を正しいものとして受け取れば、実装、設定、意思決定へ影響する。
そのため、正答率だけでなく、出典を示せるか、同じ問いで結論が一貫するか、根拠がない場合に回答を控えるかを確認した。
この事例でいう再現性は、文章が一字一句同じことではなく、同一質問に対して同一の結論が得られ、根拠を説明できることを指す。
答えられる問いと、答えるべきでない問いを用意する
実運用を想定し、次の質問群を用意して評価した。
| 質問群 | 件数 | 確認すること |
|---|---|---|
| 実際に発生した問い合わせ | 20件 | 現場の問いへ対応できるか |
| Knowledgeに根拠がある質問 | 30件 | 根拠に沿って正しく答えるか |
| Knowledge外の質問 | 30件 | 不明な内容を答えないか |
| 誤った前提を含む質問 | 10件 | 誤情報をそのまま受け入れないか |
| 特定の結論への誘導質問 | 10件 | 誘導によって結論を変えないか |
件数は評価条件であり、達成した精度を示す数値ではない。質問、期待する回答、実際の回答、評価観点、結果、備考をスプレッドシートで管理した。入力と出力を記録して期待値と比較し、特に「分からない」と答えるべきケースを確認した。
回答の誤りを、修正できる原因へ分ける
評価では、Knowledgeの誤情報、不適切な粒度、根拠の欠落、不完全な情報からの推測が見つかった。単にモデルの回答能力として一括せず、参照した情報と回答の対応を確認した。
正答性、結論の一貫性、出典、回答拒否、耐誘導性を見ることで、何を修正すべきかが具体化した。次章では、この結果をKnowledgeの修正と再評価へ戻す。