プロンプトの自動改善は、AI への指示文(プロンプト)の案を仕組みに作らせて試し、良いものを選ぶ方法です。英語では prompt optimization と呼びます。同じ指示文でも、AI のモデルが違えば答えも変わります。提供元がモデルを更新したあとに、それまでうまくいっていた指示文が効かなくなることもあります。人が手で書き直して試していた作業を、見本と採点の基準を使って自動で繰り返します。
この作業を行う道具の例に、DSPy があります。Python で使う道具で、スタンフォード大学の自然言語処理の研究グループ(Stanford NLP)が公開しています。DSPy の説明では、見本のデータと採点の方法を渡すと、AI が指示文の案をいくつも作ります。その案を見本で試し、点の高い指示文を残します。新しいモデルが出たときに同じ手順を回せば、入れ替える価値があるかも確かめられる、としています。
自動で選べるのは、良い答えかどうかを点数で決められる作業です。見本と基準が実際の仕事とずれていると、基準の上でだけ点の高い指示文が選ばれます。だから先に作るのは、実際の仕事から集めた入力と、望ましい答えの見本と、採点の基準です。うまくいった頼み方を見本集にするとき、1 件ごとに「期待する出力」を書いておくと、基準づくりの材料になります(頼み方の見本集の記事)。
社員が画面で AI に頼む使い方なら、この道具は要りません。問い合わせの分類や書類の読み取りのように、同じ指示文を仕組みの中で何度も使う作業で検討します。