本文へ移動
  1. トップ
  2. 用語集
  3. AI の評価(エバリュエーション)
用語集

AI の評価(エバリュエーション)とは

要点よみ: えーあいのひょうか

決まった問題と採点の基準を用意して AI の答えの出来を測り、モデルや指示文を比べること。

AI の評価は、決まった問題を AI に解かせ、決めておいた基準で答えを採点して、出来を測ることです。英語の evaluation から、略して eval とも呼ばれます。同じ問題と同じ基準を使い続けると、AI のモデルを替えたときや指示文を直したときに、良くなったのか悪くなったのかを比べられます。基準を決めずに使い比べると、目についた何回かの答えの印象で選ぶことになります。

始めるときは、作業ごとに見本の問題を少し作ります。Anthropic は 2026 年 1 月の技術記事で、何百問も要ると考えて後回しにするより、実際に起きた失敗から集めた 20〜50 問の簡単な問題で始めれば十分だとしています。問い合わせの返信の下書きなら、過去の問い合わせと実際に送った返事を組にして 1 問にします。良い問題は、詳しい人が 2 人で別々に採点しても同じ合否になるものです。答えに必ず入れること、書いてはいけないことを、採点の基準として書いておきます。

採点は、決まった言葉が入っているかを機械で照らす方法、AI に基準を渡して採点させる方法、人が読む方法を組み合わせます。点数だけで決めず、不合格になった答えも読みます。採点の仕組みのほうが、正しい答えを不合格にしていることもあるからです。最初の点数はベースラインとして残し、変えた後の点数と比べます。