本文へ移動
  1. トップ
  2. 用語集
  3. マルチモーダル AI
用語集

マルチモーダル AIとは

要点よみ: まるちもーだるえーあい

文章だけでなく、画像・音声・動画など複数の種類の情報を扱える AI。

マルチモーダル AI は、文章、画像、音声、動画など、種類の違う情報をまとめて扱える AI です。写真を見せて中身を説明させる、書類の画像から値を読み取らせる、会議の音声から議事録を作らせる、といった使い方ができます。当社の AI基礎研修では、第 1 部で AI の基礎(セキュリティの基礎を含む)を話し、第 2 部で代表が画面でパソコンを操作して AI エージェントを実演します。

便利な一方で、画像や音声から読み取った値には、読み違いが混じります。手書きの文字、かすれた印刷、似た形の英字(A と B など)は、とくに間違えやすいところです。数字や品番のように、間違えると困る値は、人が元の資料と照らします。当社が PDF の指示書を表にしたときに出た読み違いの型は、3 回読ませて比べる記事にまとめました。

画像として貼られた資料は、AI が読めても、社内の検索では見つかりません。資料を AI に使わせる前提なら、画像を文字に起こしておくと、検索にも AI にも使えます。