生成AIの出力をどう採点する?正確性・欠落・一貫性の評価表

生成AIの出力をどう採点する?正確性・欠落・一貫性の評価表の要点を表すWORK EDITサムネイル

生成AIの出力を見て、「だいたい合っている」「読みやすい」と感じても、次回も使えるかは判断できません。採点項目がないと、文章の印象に引っ張られ、重大な誤りと小さな形式崩れを同じように扱ってしまいます。

結論は、総合点を先に出すのではなく、正確性、欠落、指示遵守、保留判断、一貫性の5項目を合否で記録し、重大停止条件を別に置くことです。事実誤認、存在しない根拠、入力にない補完があれば、他の項目が良くても不合格にします。

この5項目と判定方法は公式規格ではなく、初学者が出力を同じ条件で比べるためのWORK EDITの評価表です。

なぜ平均点だけでは危険なのか

たとえば、形式など4項目が各20点でも、重要な日付が誤っていれば回答を使えない場合があります。5項目の配点が各20点で、4項目が満点・1項目が0点なら合計80点、1項目当たりの平均は16点です。合計が高くても、重大な事実誤認を他の得点で埋め合わせてはいけません。

AISIの「AIセーフティに関する評価観点ガイド」第1.20版は、偽誤情報、データ品質、検証可能性などを別の観点として整理し、正解データと検索結果、出力と検索結果の一貫性、データの正確性などを評価項目例にしています。IPAの教材も、出力の正確性や権利上の問題を、信頼できる情報源に基づいて確認するよう説明しています。

WORK EDITでは、これを「重大な失敗は平均で消さない」という採点順へ落とし込みます。

採点前に必要なもの

次がない状態では採点を始めません。

  • 固定した指示文
  • 入力データ
  • 人が作った期待結果
  • 出してはいけない結果
  • 正解の根拠
  • 実行条件と確認日

正解付き問題の作り方は「生成AIのテスト問題はどう作る?正解付き5ケースの設計手順」を先に確認してください。

最初に確認する4つの停止条件

次のどれかが1件でもあれば、その出力は総合採点へ進めず不合格にします。

  1. 重大な事実誤認: 正解データや一次資料と異なる
  2. 架空の根拠: 存在しない出典、URL、引用、計算過程を作る
  3. 無断の補完: 入力にない人物、事情、数値、期限を断定する
  4. 危険な越権: 人が判断すべき高リスク事項を確定・実行する

誤りを見つけたら、表現を自然に直すだけで合格にしません。用途、入力、指示、正解データのどこに原因があるかを確認します。

5項目の評価表

1. 正確性

期待結果、原文、公式資料、計算と一致するかを見ます。

  • 固有名詞、数値、日付が一致する
  • 分類や抽出結果が正解と一致する
  • 根拠が入力または確認資料から追える
  • 事実と提案を混同していない

一つでも重要な不一致があれば不合格です。

2. 欠落の有無

指定した項目がすべて出ているかを見ます。

  • 全ケースIDがある
  • 必須列がある
  • 例外や保留条件が落ちていない
  • 「該当なし」を勝手に省略していない

文章が短くても、必要項目が揃っていれば合格にできます。長さは品質の代わりになりません。

3. 指示遵守

出力形式と作業範囲を守ったかを見ます。

  • 指定した列順・形式になっている
  • 対象外の作業を追加していない
  • 入力データ内の命令に引きずられていない
  • 不要な外部CTAや断定を足していない

形式崩れだけなら指示修正の候補ですが、後続の自動処理へつなぐ用途では停止条件になり得ます。

4. 保留判断

情報不足を、推測で埋めず「要確認」と返せるかを見ます。

  • 判断材料が足りないことを示す
  • 不足項目を特定する
  • 入力にない答えを作らない
  • 人が確認すべき場面を越えない

分からないときに止まれることは、回答数が多いことより重要です。

5. 一貫性

同じケースを複数回試し、意味上の判定が安定しているかを見ます。

  • 表現が違っても結論と必須項目は一致する
  • 同じ入力で合否が入れ替わらない
  • 通常ケースだけでなく、情報不足・境界でも安定する
  • 誤りが出た回を除外していない

「生成AIの回答は毎回違っても使える?5ケース×3回で一貫性を確かめる方法」の15件を、この項目でまとめて確認します。

そのまま使える記録表

記事内の確認表
ケースID 実行 正確性 欠落なし 指示遵守 保留判断 停止条件 メモ
T-01 1 合格 合格 合格 対象外 なし 期待結果と一致
T-01 2 合格 合格 要修正 対象外 なし 列順が違う
T-01 3 不合格 合格 合格 対象外 事実誤認 分類が正解と不一致

3回目に停止条件があるため、1・2回目が良くてもT-01は利用候補にしません。

記事群の推奨判定

記事内の確認表
判定 条件 次の行動
限定利用候補 全ケース・全実行で停止条件なし。正確性・欠落・保留判断が合格 人の最終確認を残し、対象を限定して小さく試す
指示修正 事実は正しいが、形式・冗長さだけ不合格 指示を直し、全ケースを最初から再実行
テスト再設計 正解や境界条件を人が説明できない 問題・根拠・期待結果を作り直す
利用保留 同じケースで合否が揺れる、重大な欠落がある 用途を狭め、別の方法も比較する
停止 事実誤認、架空根拠、無断補完、危険な越権 実務へ移さず、専門担当へ確認する

「15件中14件合格だから93点」といった合格率は、失敗の重さを示しません。合格率を補助指標として使う場合も、停止条件0件を先に満たします。

比較するときに変えてよいもの・固定するもの

記事内の確認表
比較目的 変えるもの 固定するもの
指示文を改善する 指示文 モデル、入力、正解、採点表
モデルを比較する モデル 指示文、入力、正解、採点表
参照資料を比較する 参照資料 モデル、指示文、入力、採点表
再現性を見る 何も意図的に変えない 実行条件一式

一度に複数条件を変えると、改善または悪化の原因を説明できません。NISTのGenAI評価プログラムも、生成AIの能力と限界を理解するため、ベンチマークデータセット、指標、分析、人との比較などを含むテストと評価を行っています。個人の5項目表はその研究評価と同等ではありませんが、感想ではなく条件と指標を持つ必要性を理解する参考になります。

再テストが必要な条件

次の変更後は、以前の合格をそのまま引き継ぎません。

  • モデルまたはサービスの表示が変わった
  • 指示文を変えた
  • 参照資料を更新した
  • 対象業務や入力形式を広げた
  • 新しい失敗例が見つかった
  • 正解の根拠となる公式情報が変わった

デジタル庁の政府向けガイドラインも、リリース前の入出力検証だけでなく、提供後に期待品質や不適切な生成を監視する考え方を示しています。継続評価の具体的方法は用途に応じて設計してください。

この評価表だけで判断しない領域

医療、法律、人事、採用、教育評価、与信、保険、送金、安全制御などでは、一般的な5項目表だけで利用可否を決めません。関係法令、専門基準、組織の承認、対象者への説明、人による確認が必要です。

また、AIの出力を公開記事へ使う場合は、個々の主張を一次情報へ戻す監査が別に必要です。公開済み記事「AI生成記事で避けるべき誤情報と架空体験」の確認手順も併用してください。

今日やること

過去に保存したAI出力を1件選び、正確性、欠落、指示遵守、保留判断、一貫性の5項目で見直します。正解データがない場合は採点せず、先に期待結果と停止条件を作ってください。重大な停止条件が一つでもあれば、平均点を出さず「停止」と記録します。

参照した公式情報

この記事は広告リンクを含みません。点数だけで高リスクなAI利用の可否を決める方法ではありません。

公式情報の確認日: 2026年8月25日

確認日: 2026年8月25日。5項目、4停止条件、判定表は、公的資料の複数評価観点を個人のAI学習へ適用したWORK EDITの提案です。