Rosarium

用語・参照資料 / Reference / principle

評価指標リファレンス

検索や回答、人への引き継ぎがうまく働いているかを、何で測るか確認する資料です。Retrieval・安全性・運用品質・レビュー負荷の指標を、対象集合や閾値と合わせて定義します。

最終更新:

Evaluation / RAG

読む目的: AI導入・責任・評価 / 自然言語サービス・RAG・ナレッジ

評価指標リファレンス

評価指標は、どの入力集合を、どの判定基準で、いつ測ったかと合わせて記録する。平均値だけでDomain別・Risk別の差を隠さない。

Retrieval

指標定義読むときの注意
Recall@k正解根拠のうち上位kk件へ取得できた割合正解根拠集合の作り方に依存する
Precision@k上位kk件のうち関連根拠であった割合高くても必要な根拠を欠く場合がある
Coverage評価対象のうち回答・処理した割合低ければ安全とは限らず、移管費用も生じる

回答・根拠

指標定義読むときの注意
Groundedness出力中の主張が提示根拠で支持される度合い根拠自体の正しさは別途確認する
Correctness定義した正解または専門家判断との一致正解が一意でないTaskでは判定規則が必要
Completeness必要な論点を満たした度合い長い回答を優遇しない基準が必要
Consistency同条件または同義入力での判断の整合性多様性が必要なTaskとは分けて扱う

受理・拒否

Coverage=NanswerNCoverage=\frac{N_{answer}}{N} Selective Risk=Nerror within answerNanswerSelective\ Risk=\frac{N_{error\ within\ answer}}{N_{answer}}
指標定義
FARP(accept∣unsafe)P(accept\mid unsafe)。受理してはいけない出力を受理する割合
FRRP(reject∣safe)P(reject\mid safe)。利用可能な出力を拒否する割合
Selective Risk回答・受理した集合の中での誤り率

閾値を厳しくするとFARが下がりFRRが上がる場合がある。安全性、業務価値、人間への移管量を同時に評価する。

運用と人間負荷

指標確認する内容
Latencyend-to-end時間と工程別時間
Costモデル、検索、Tool、再試行、運用を含む費用
Human Review負荷件数だけでなく、確認時間・難度・差戻し率
Override率人間がAI候補を修正・却下した割合と理由
Incident / Near miss誤受理、誤実行、検出された未遂と影響