本文へ移動
  1. トップ
  2. 用語集
  3. 継続事前学習(CPT)
用語集

継続事前学習(CPT)とは

要点よみ: けいぞくじぜんがくしゅう

学習を終えたモデルに、ある分野の大量の文章を追加で読ませ、その分野の知識そのものを足す学習。

継続事前学習は、学習を終えた AI のモデルに、ある分野の大量の文章を追加で読ませる方法です。その分野の言葉や知識を、モデルに身に付けさせます。英語の Continued Pre-Training の頭文字から、CPT とも呼びます。モデルを最初に作るときの学習(事前学習)を、自分で用意した文章で続けることから、この名前があります。

ファインチューニングとの違いは、学ばせるものです。ファインチューニングは、「この入力にはこう答える」という見本の組を学ばせ、答え方を整えます。継続事前学習は、答えの付いていないふつうの文章を大量に読ませ、知識の側を足します。AWS は 2023 年 11 月、自社の AI のサービスで両方を使えるようにしました。そのときの説明では、ファインチューニングは数百件の見本で効果が見え始めることがあるとしています。一方の継続事前学習は、少なくとも 10 億トークン分の文章を与えると効果が出ることが多い、としています。

文章を集めてそろえる手間、学習に使う計算機の費用、資料が変わったときの学ばせ直しを考えると、中小企業が最初に選ぶ方法ではありません。社内の資料を踏まえて答えさせたいなら、まず資料を探して AI に渡す仕組み(RAG)を試します。指示文に会社の情報を書いておくだけで足りることもあります。どの方法でも、先に要るのは、資料を文字で読める形にして、決まった場所にそろえることです(社内の資料に AI で答えさせる前の記事)。