Rosarium

実践事例 / 公開物 / case

第9章 正しさ・出典・回答拒否から、QAの利用可否を評価する

構築したQAを、正しさ・出典・一貫性・耐誘導性などの観点で評価する。誤情報、粒度、根拠不足、推測による回答を見つけ、改善対象を明確にする。

公開:最終更新:

更新履歴

  1. 公開

ai / 設計 / リファクタリング / レガシー / rag

読む目的: 自然言語サービス・RAG・ナレッジ / AI × ソフトウェア開発 / 事例・実務

このBookの目次(全12章)
  1. 全体構成
  2. 第1章 仕様を答えられない状態から、復元すべき情報を決める
  3. 第2章 対象システムの変更を妨げる構造と知識の不足を整理する
  4. 第3章 調査の起点を作るため、ファイルとクラスの役割を整理する
  5. 第4章 コードから仕様と依存関係を復元する
  6. 第5章 処理の流れを復元し、変更影響を追えるようにする
  7. 第6章 人が読む仕様とAIが使うKnowledgeを分ける
  8. 第7章 UI操作と内部処理を結び付け、操作結果を追えるようにする
  9. 第8章 復元したKnowledgeを、根拠を確認できるQAへつなぐ
  10. 第9章 正しさ・出典・回答拒否から、QAの利用可否を評価する
  11. 第10章 評価結果をKnowledgeと回答範囲の改善へ戻す
  12. 第11章 仕様変更に追従できるKnowledge更新フローを作る
  13. 第12章 QAで暗号処理を調査し、人間の変更判断へつなぐ
目次
  1. 誤った回答が、変更や設定の根拠にならないか
  2. 答えられる問いと、答えるべきでない問いを用意する
  3. 回答の誤りを、修正できる原因へ分ける

現在位置:第9章・全12章

誤った回答が、変更や設定の根拠にならないか

QAが回答できても、その内容を仕様確認に使えるとは限らない。誤答を正しいものとして受け取れば、実装、設定、意思決定へ影響する。

そのため、正答率だけでなく、出典を示せるか、同じ問いで結論が一貫するか、根拠がない場合に回答を控えるかを確認した。

この事例でいう再現性は、文章が一字一句同じことではなく、同一質問に対して同一の結論が得られ、根拠を説明できることを指す。

答えられる問いと、答えるべきでない問いを用意する

実運用を想定し、次の質問群を用意して評価した。

質問群件数確認すること
実際に発生した問い合わせ20件現場の問いへ対応できるか
Knowledgeに根拠がある質問30件根拠に沿って正しく答えるか
Knowledge外の質問30件不明な内容を答えないか
誤った前提を含む質問10件誤情報をそのまま受け入れないか
特定の結論への誘導質問10件誘導によって結論を変えないか

件数は評価条件であり、達成した精度を示す数値ではない。質問、期待する回答、実際の回答、評価観点、結果、備考をスプレッドシートで管理した。入力と出力を記録して期待値と比較し、特に「分からない」と答えるべきケースを確認した。

回答の誤りを、修正できる原因へ分ける

評価では、Knowledgeの誤情報、不適切な粒度、根拠の欠落、不完全な情報からの推測が見つかった。単にモデルの回答能力として一括せず、参照した情報と回答の対応を確認した。

正答性、結論の一貫性、出典、回答拒否、耐誘導性を見ることで、何を修正すべきかが具体化した。次章では、この結果をKnowledgeの修正と再評価へ戻す。