本文へ移動
  1. トップ
  2. 用語集
  3. 全文検索(文字の一致で探す検索)
用語集

全文検索(文字の一致で探す検索)とは

要点よみ: ぜんぶんけんさく

資料の本文に書かれた文字を手がかりに、探している言葉を含む資料を見つけ出す検索の方法。

全文検索は、資料の本文に書かれた文字を手がかりに、探している言葉を含む資料を見つける検索の方法です。ファイルの名前だけでなく、中の文章まで探せます。資料が多いと毎回頭から読むのでは遅いため、多くの仕組みは、どの言葉がどの資料にあるかを記した索引を先に作り、その索引を引いて探します。

意味の近さで探す方法(エンベディングとベクターデータベース)との違いは、言葉が一致するかどうかです。全文検索は、型番、エラーの番号、取引先の名前、規程の条番号のように、その文字そのものを探すときに向いています。その代わり、同じことを別の言い回しで書いた資料は見つけられません。Anthropic が 2024 年 9 月に公開した検索の改善の記事も、意味で探す方法は、エラーの番号のような完全な一致を取りこぼすことがあると書いています。そのうえで、2 つの方法で探して結果をまとめる手順を紹介しています。

社内の資料を AI に探させる仕組み(RAG)を考えるときも、資料が増えてきたら、まず資料の一覧と全文検索で目的の資料にたどり着けるかを確かめます。言い換えの取りこぼしで困る場面が増えてから、意味で探す方法を足しても遅くありません。

見つからない原因で多いのは、文字が文字として入っていない資料です。紙を写した PDF や、画面の写しを画像で貼った資料は、中の文字で探しても出てきません(OCR で文字に起こせます)。日本語は単語の間に空白が無いので、仕組みによっては区切り方の設定も要ります。MySQL の説明書には、空白で区切る標準の方式のほかに、文字を決まった数ずつ(初期の設定では 2 文字ずつ)区切って日本語にも使える方式が載っています。資料を移したら、実際の言葉で探して見つかるかを確かめます(社内の資料に AI で答えさせる前の記事)。