記事評価・ヒューマンレビュー / AI設計 / guide
AI評価データセットと回帰評価設計
通常・曖昧・情報不足・拒否すべき入力と期待動作を評価データセットに記録する。システム全体の版管理、回帰比較、AI採点の確認、本番の失敗を評価へ戻す運用を扱う。
更新履歴
読む目的: AI導入・責任・評価
目次
AI評価データセットと回帰評価設計
種別:評価設計 / 変更管理 適用対象:生成AI、RAG、QAチャット、AIエージェント 対象工程:評価 / リリース / 変更 / 再評価
はじめに
生成AIは、数件の質問へうまく答えたからといって、業務で使えるとは限らない。
実際の業務には、普通の質問だけでなく、曖昧な質問、情報が足りない質問、答えてはいけない質問もある。
AIを評価するには、こうした質問と期待する動作を集めた評価データセットが必要である。
評価データセットは、単なる問題集ではない。
AIシステムが、どの場面で答え、どの場面で止まり、どの場面で人へ渡すべきかを確認するための基準である。
モデルだけを評価しない
利用者が受け取る結果は、モデルだけで決まらない。
- 利用者の質問
- プロンプト
- RAGが検索した文書
- 使用したモデル
- 出力を確認する仕組み
- 外部ツール
- 人間承認
どれかが変われば、同じ質問でも結果が変わる可能性がある。
したがって評価時には、「どのモデルを使ったか」だけでなく、システム全体の版を記録する。
一件の評価データに必要なもの
一件の評価データには、質問と模範回答だけでなく、次の情報を持たせる。
| 項目 | 内容 |
|---|---|
| 入力 | 利用者の質問や依頼 |
| 前提 | 利用者の役割、地域、製品、時点など |
| 期待する動作 | 回答、追加質問、拒否、人への移管 |
| 必須内容 | 回答へ含めるべき条件や根拠 |
| 禁止内容 | 書いてはいけない情報や実行してはいけない操作 |
| 重要度 | 間違えた場合の影響 |
| 由来 | 実際の問い合わせ、事故、設計上の想定など |
正しい文章を一つに固定できない場合もある。そのときは、一字一句の一致ではなく、必要な内容と禁止内容を決める。
普通の質問だけを集めない
評価データは、少なくとも次の種類へ分ける。
通常ケース
日常的によく使われる質問である。普段の使いやすさを確認する。
境界ケース
条件がぎりぎり変わる質問である。
たとえば、申請期限の前日と翌日、対象製品と対象外製品などである。
情報不足ケース
質問だけでは答えられないケースである。AIが勝手に補わず、追加質問できるかを見る。
範囲外ケース
AIが担当しない質問である。無理に答えず、適切な窓口へ案内できるかを見る。
危険ケース
機密情報の要求、不正な指示、権限外の操作などである。
過去の失敗ケース
本番で起きた誤回答や事故である。同じ問題が再発しないか確認する。
件数だけでなく、偏りを見る
評価件数が多くても、似た質問ばかりでは意味がない。
たとえば、国内製品の簡単な質問だけで高得点でも、海外製品や長い質問で大きく崩れるかもしれない。
結果は、次のようなグループへ分けて見る。
- 製品や業務分野
- 利用者の役割
- 質問の長さ
- 使用言語
- 重要度
- 回答、拒否、移管の種類
全体平均が良くても、重要な領域だけ悪化していればリリースすべきではない。
評価用データを使い回しすぎない
同じ評価データを見ながら何度もプロンプトを直すと、その問題だけに合わせたシステムになる。
学校の試験問題を事前に覚えるのと似ている。
そのため、データを役割で分ける。
| 種類 | 用途 |
|---|---|
| 開発用 | 改善点を探すために使う |
| 回帰評価用 | 以前できたことが壊れていないか確認する |
| 最終確認用 | 開発中には見ず、リリース前に使う |
すべてを完全に秘密にする必要はないが、改善用と最終確認用を分ける考え方は必要である。
回帰評価とは何か
回帰評価は、変更によって以前できていたことが壊れていないかを見る評価である。
たとえば、新しいプロンプトで回答が読みやすくなっても、引用の正確さが下がることがある。モデルを替えて速度が上がっても、拒否すべき質問へ答えるようになることがある。
変更前と変更後を、同じ評価データで比べる。
見る対象には次がある。
- 回答の正しさ
- 根拠との一致
- 適切な拒否と移管
- セキュリティ上の違反
- 待ち時間
- 費用
一つの点数へまとめすぎると、どこが良くなり、どこが悪くなったか見えなくなる。
AIによる採点を正解扱いしない
大量の回答を別のAIに採点させる方法は便利である。しかし、採点するAIも間違える。
文章が流暢だから高得点にしたり、特定の書き方を好んだりする可能性がある。
AI採点を使う場合は、人間の採点結果と定期的に比べる。重要なケースは人間が直接確認する。
AI採点は評価を助ける道具であり、正解そのものではない。
本番の失敗を評価へ戻す
評価データセットは、リリース前に一度作って終わりではない。
本番で起きた誤回答、過剰な拒否、問い合わせ、手作業での修正を集め、再発防止の評価ケースへ加える。
ただし、本番データには個人情報や機密情報が含まれる。匿名化し、利用目的と保存期間を決めて扱う。
まとめ
AI評価データセットは、AIへ答えさせる質問集ではない。
実際の業務、境界、危険、過去の失敗を再現し、変更によって何が良くなり、何が壊れたかを確かめるための資産である。
モデル、プロンプト、文書、ツールのどれを変えても、同じ基準で比較できるように版管理する必要がある。
参考資料
- Liang et al., Holistic Evaluation of Language Models, 2022
- NIST, AI Risk Management Framework 1.0, 2023
- Es et al., RAGAS: Automated Evaluation of Retrieval Augmented Generation, 2023
- Min et al., FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation, 2023