台本から研修の動画を AI で作るとき、人が確かめるのは 3 つです。画面に出る図に、台本に無い事実が入っていないか。動画の長さが、受講の案内に書く学習時間と合っているか。図が、教える内容として適切か。当社では、最初の 2 つを機械の検査に組み込み、3 つ目は人が見る工程として残しています。
2026 年 8 月、当社で作っている企業研修向けの e ラーニングの教材について、動画を台本から作る決まりと仕組みを作りました。動画にする教材は 348 本、受講の案内で決めた時間を合計すると 3,633 分(約 60.5 時間)です。台本のナレーションは、すべて書き上がっていました。
人の声で録って編集すると、間に合わない量でした
人が録音し、編集する前提で計画を立てると、動画だけで 3,437 時間かかる見込みでした。社長が決めた作り方は、次の 4 つです。
| 決めたこと | 中身 |
|---|---|
| 声 | AI の合成の声で、全部の動画を同じ声にする |
| 画面 | スライドだけ。人物は映さない |
| 文字 | ナレーションの全文を画面の下に字幕として出し、字幕のファイルも付ける |
| 作る順番 | 最初のコースから |
合成の声にした理由は、改訂のしやすさです。教材は半年ごとに一部を直す前提で、1 本だけを同じ声で差し替える場面が出ます。人の声だと、そのたびに同じ話し手を確保しなければなりません。
- 動画にする教材
- 348本
- 受講の案内で決めた時間の合計
- 3,633分 約 60.5 時間
- 人が録音・編集する前提の見込み
- 3,437時間
出所: 当社の制作の記録(2026 年 8 月)
台本から動画になるまで
- 台本を読むナレーションの文を、音声と字幕の区切りに分ける
- 図を作る台本の画面の指示から、AI が図のデータを作る
- 図を照らす図の言葉と数字が台本にあるかを機械で照らす
- 声を作る区切りごとに音声を合成し、前後の無音を落とす
- 長さを合わせる受講の案内の時間に合うよう、話す速さを整える
- 組み立てる画面と声と字幕を合わせ、動画と字幕のファイルにする
ナレーションは、句点ごとに区切ります。1 つの区切りが、音声を合成する単位であり、画面の字幕を出す単位であり、字幕のファイルの 1 行でもあります。同じ区切りを使うので、声と字幕がずれません。字幕の時刻を人が合わせる作業がそもそも生まれない作りです。全 348 本で、区切りは 56,529 になりました。
図が無いと、画面は見出し 1 行だけになります。試しに 1 本を図なしで作ったときは、本編の 155 枚の画面すべてが見出しだけでした。11 分のうち 10 分以上、受講者は見出し 1 行を見ながら声を聞くことになります。台本には、どの場面で何を映すかの指示が 1,520 か所あり、これを表・箇条書き・比べる図・書類の抜き書き・流れ・数字の 6 つの型と「図なし」に分けました。
図を作る AI は、台本に無い氏名や生年月日を書き足しました
最初に図を作らせたとき、ある教材の図に、台本に無い情報が入っていました。台本では「書いてあるのは、利用者の氏名、生年月日、住所、要介護度、体の状態、家族の構成です」と、項目の名前だけを話しています。ところが図には、ありふれた架空の氏名、1940 年代の生年月日、歩くときの様子、家族の構成までが書き込まれていました。
画面に出た文字は、教材に書いたことと同じ扱いになります。助成金を使った研修でも使う前提の教材なので、台本に無い事実を画面に出すわけにはいきません。図を作る AI には「本文が項目の名前しか言っていないときは、値を作らず空欄にする」と指示しました。ただ、指示だけでは足りないので、図ができたあとに機械で照らす検査を入れています。
- 言葉を拾う図の中から、数字の並び、3 字以上のカタカナ、2 字以上の漢字、2 字以上の英字を拾う
- 台本と照らす拾った言葉が、その教材の本文・見出し・画面の指示・学びのねらいにあるかを見る
- 作り直す無い言葉が 1 つでもあれば差し戻し、その言葉を示して作り直させる(3 回まで)
- 図をやめる3 回とも通らなければ、その場面は図なしにする
検査を入れてからは、さきほどの図は、項目の名前と空欄の並びに直りました。この検査を外して図を使うことはしない、と決まりに書いています。
動画の長さは、受講の案内に書く学習時間に合わせます
e ラーニングでの研修に助成金を使う場合、研修の時間は、受講の案内などで前もって決めた「標準学習時間」で判断されます(厚生労働省の人材開発支援助成金の案内)。動画の長さが案内の時間と大きく食い違えば、案内そのものが正しくなくなります。当社の台本の決まりでは、1 分あたり 340 字で話す前提で各教材の時間を決め、できた動画の長さを、決めた時間から 5% 以内に収めることにしています。
ところが、合成の声がそのまま話す速さは、声の種類によって 1 分あたり 244〜315 字で、どれも 340 字より遅いものでした。何もしなければ、動画は決めた時間より最大で 28% 長くなります。そこで、次の順で長さを合わせています。
- 区切りごとに声を作り、前後に付いてくる無音を落とす
- 区切りの間の「間」は、こちらで決めた長さだけにする(同じ段落の中は 0.12 秒、段落の切れ目は 0.38 秒、節の切れ目は 0.90 秒)
- 話している部分の合計と、間の合計を測る
- 話している部分だけを、声の高さを変えずに伸び縮みさせ、決めた時間に合わせる
- 伸び縮みの倍率が 0.80〜1.30 から外れたら警告し、台本か決めた時間を見直す
無音を落とさずに合わせようとしたときは、25% も早回しにしなければなりませんでした。無音の分まで話す部分を速めてしまうからです。
- 決めた時間(11 分)
- 660.0秒
- できた動画の長さ
- 659.9秒
- 決めた時間とのずれ
- -0.02%
出所: 当社の制作の記録(2026 年 8 月 18 日の試作)
BGM と効果音は入れていません。就業時間中に 1 日 1〜2 本を見る受講者を想定していて、音楽は内容の理解を助けないからです。
変わりやすい事実は、作り直さずに直せる場所に置きます
動画のファイルは、作業の記録の置き場所(Git)には置いていません。全部で約 10 GB になるうえ、台本と図のデータがあれば何度でも作り直せるからです。正本は台本と図のデータで、動画はそこから作るものとして扱います。
ボタンの名前、料金、AI のモデルの名前のように変わりやすい事実は、ナレーションではなく図の側に書きます。図のデータを直せば、動画の長さを変えずに直せます。ナレーションの文を直すと長さが動き、決めた時間とのずれを確かめ直すことになります。
機械では確かめられないことが残っています
- 図が、教える内容として適切か(何を見せるかの選び方)
- 画面の操作を見せる教材は、実際の画面を録画して差し替えたか
- 話す速さの設定が、2 本目以降の教材でも決めた時間に収まっているか
- AI の声であることを、受講者に分かるように示しているか
図の検査が確かめているのは、台本に無い言葉が入っていないことだけです。その場面で何を見せるべきかという教え方の判断は、人のレビューが要ります。この記事を書いている時点では、まだ人のレビューは終わっていません。画面の操作を見せる教材は、最初のコースだけで 6 本あり、これは図では代わりにならないので、実際に録画します。
声については、当社が使っている OpenAI の音声合成の案内に、聞いている人に AI の声であることをはっきり示すよう、利用規約で求めていると書かれています。
社員向けの研修を、助成金の要件に合わせて組み立てる場合は、リスキリング研修で、計画と記録の残し方から一緒に進めます。研修に助成金を使う前に確かめることは助成金の記事に、この記事に出てきた標準学習時間と音声合成の意味は用語集に書きました。



