AI評価データセットと回帰評価設計
通常・曖昧・情報不足・拒否すべき入力と期待動作を評価データセットに記録する。システム全体の版管理、回帰比較、AI採点の確認、本番の失敗を評価へ戻す運用を扱う。
最終更新:
AIの答えをどこまで機械で評価し、どこから人間が判断するかを決めます。評価・ヒューマンレビューで、採用と改善の基準を設計します。
何をもって採用可能と判断するか。共通の評価データを準備し、QA回答とコード変更それぞれの検証方法へ進みます。人間へ判断を戻す責任は、責任境界・制御で扱います。
通常・曖昧・情報不足・拒否すべき入力と期待動作を評価データセットに記録する。システム全体の版管理、回帰比較、AI採点の確認、本番の失敗を評価へ戻す運用を扱う。
AIの回答が正しいかだけでなく、根拠の提示、回答を控える判断、人への引き継ぎも評価します。検索から業務効果までを分けて測り、QAの改善箇所を見つけます。
AIが書いたコードを、安全に採用できる変更かどうか確認する工程を設計します。コンパイラ・テスト・静的解析・人間のレビューを組み合わせ、未確認の変更を本番へ流しません。
生成・検証・承認・実行を、一つの業務システムの境界へ配置します。システムアーキテクチャ