【目次】
オープニング
音声から動画を作る仕組み
検証と改善の積み重ね
数秒のサンプルから始める
質問に答えて設計を固める
人が担うレビューと素材抽出
動画化に挑戦する手順
お知らせ
エージェントスキルの解説回
https://open.spotify.com/episode/2J2TC9jjsU9TUNtpzvTKUF
今回の内容の解説記事
https://hataracraft.com/articles/podcast-slide-animation
無料AI活用メルマガ
https://taichiaiworker.substack.com
AIで業務コスト削減の無料相談はこちら
感想
まだ感想はありません。最初の1件を書きましょう!
サマリー
音声ファイルと文字起こしから、AIとプログラムでアニメーションスライド動画を自動生成する仕組みを説明する。工程は、AIによるカット割り、スライド画像生成、画像部品の切り出し、Remotionによる動画化の4段階で、WhisperやAgent Skillsも使われている。開発では数秒のサンプルから検証し、Grill with Docsで設計を固めたうえで改善を重ねた。カット割りのレビューや複雑な部品の透過処理は人が担うことで、AIの不安定さを補っている。
音声からアニメーション動画を作る4工程
こんにちは、超実践AI論のたいちです。 今回は、音声1本からアニメーションスライド動画を作る仕組み、というテーマでお話しします。
今あなたが見ているこの動画も、話の流れに合わせて文字やイラストが順番に出てきていると思います。 今回は、この仕組みをAIを使ってどのように作成したかをお話しします。
この動画の元になっているのは、収録した音声ファイル1つと、その文字起こしだけです。 文字起こしは、Whisperというツールで、無料で簡単に作成できます。
動画は、AIとプログラムを組み合わせて、全部で4つの工程で作られています。 そして、4つの工程を、Agent SkillsというAI専用の手順書にまとめ、実際に動画を作るときは、対象の音声ファイルを渡して、動画化スキルを呼ぶだけで、音声を元にアニメーション動画が自動で作成されます。
Agent Skillsの基本知識は、概要欄にスキルの解説会を貼っておくので、参考にしてみてください。 動画作成の4つの工程に話を戻します。
まず最初の工程は、AIによるカット割りの設計です。 文字起こしを話のまとまりごとに区切り、各まとまりをワンカットとして分割します。
次の工程で、AIがカット1枚ごとにスライドを1枚画像生成します。 そしてその次に、生成した画像を部品に分けます。
1枚の画像のままだと、話の流れに合わせてアニメーションで要素を表示させることはできないので、カット割りの構成に応じて文字やイラスト、アイコンなどを別々の画像として切り出します。
そして最後の工程で、ここまで作ってきた音声、文字起こし、カット割り、画像、部品を使ってアニメーション動画を作成します。
動画を作るところはRemotionというツールを使っています。Remotionは動画をプログラムで作れるツールです。
動画の動きやアニメーションをプログラムで制御できるので、AIにとって扱いやすいです。 なので動画作成工程はRemotionを使っています。
この動画作成スキルは最初から今の形だったわけではなく、一つずつ部品を作り検証して改善を繰り返しながら今の形になりました。
サンプル検証と改善の積み重ね
まずは文字起こしがどのくらいの精度でできるのか。
精度が悪かったので文字起こしをしたら、AIによる誤字脱字の修正工程を挟んだり、カット割りに応じて画像生成をさせると、
どれも同じようなカットになったので、プロンプトを何度も何度も調整したり、そういった地道な改善の積み重ねで今の動画作成スキルが出来上がっています。
そして今もなお、作った動画を確認しながら、より良くできることがあれば少しずつ改善しています。
ここからはこの動画作成スキルを最初に作るときにどのように作業を進めたかをお話しします。
まずはGPT-6のAstraで音声ファイルと文字起こしのみから、どの程度のスライドアニメーション動画が作れるのかを検証しました。
具体的な指示内容は音声ファイルを渡して、この音声ファイルを元に話の内容に応じたスライド画像を生成し、話の流れに沿ってリモーションでアニメーションをつけて、まずはサンプルとして数秒分作成して、というものです。
出てきたサンプルが、まだ微調整は必要なものの、それなりのクオリティだったので、本格的に作ってみることにしました。
AIが実現できるかわからない作業は、このように、まずは少しだけサンプルを作らせてから、本格的な開発に着手するといいです。
なぜなら、一気に完成版を作って、成果物が満足のいくものじゃなかった場合、そこまでのトークンが無駄になるからです。
Grill with Docsで設計を固める
音声の動画化スキルを作るにあたり、まずはGrill with Docsというエージェントスキルで設計をしました。
これは有名エンジニアのマットポックスさんが作ったスキルで、誰でもNPXのワンコマンドでインストールすることができます。
このスキルを使うと、やりたいことについて、AIが一つ一つ質問をぶつけてきます。
その質問に全て答えることで、AIとの認識のズレを潰した上で、作業に当たることができます。
AIからの質問には、AIが思う推奨回答がついています。
その推奨回答に、自分との認識のズレがなければ、それを選ぶだけで設計は固まっていきます。
Grill with Docsのスキルについては、過去に解説した回があるので、概要欄に貼っておきます。
人が担うレビューと部品抽出
このスキルを使って、動画化スキルをどのような設計にするのかをまず固めました。
ある程度規模が大きかったり、難しかったりするプログラムやスキルの開発では、
僕はGrill with Docsでまず設計を固めてから、AIに作業してもらうようにしています。
いきなりAIにすべて作らせて、こちらの認識との違いがあった場合、その直しは、手間もコストも膨大なものになるからです。
Grill with Docsで設計を固め、その設計に沿ってAIにスキルを作ってもらうと、ある程度満足のいくものはできました。
ですが、どうしてもうまくいかない2カ所だけは、自分で修正を加えました。
1つ目の修正は、カット割に対して人のレビューを挟むことです。
AIが作ったカット割には、たまに1つのカットに2つ以上の話題が入っていることがあります。
なので、カット割を作った段階で、僕がレビューをして、このカットは2つの話題が入っているので、別々のカットにしてといった指示をして微調整します。
そして2つ目の修正として、部品の切り出し作業もAIに任せるのはやめました。
1枚の画像から、イラストやアイコン、記号などを背景が透明な個別の部品として切り出すことは、一応CodeXにもできます。
ですが、CodeXでやった時は、実際は背景が透明になっていなかったり、イラストの中身がちょっと変わってしまっていたり、かなり不安定でした。
なので、この部品の作成作業は、画像の周りをカットするだけのようなシンプルな作業はプログラムでやってもらい、要素の一部に被りがあったり、特定の部品の背景を透明にしたりといった複雑な作業がある部分だけは、人がやることにしました。
実際、この部品の切り出しや背景の透過は、MacのPreviewという標準アプリで簡単にできます。
なので、1つの動画のプログラムで対応できない部品だけを手動で抽出するなら、それほど手間はかかりません。
このAIが作るカット割りは完璧ではないので、人によるレビューを入れること、部品の切り出しはプログラムでは難しいところだけ人がやるという設計は、あなたが同じような仕組みを作るときも参考になると思います。
音声動画化に挑戦する手順
音声だけから動画を作れると、動画作成のハードルはぐっと下がります。
ぜひ、あなたもGPT-6のAstraで音声ファイルをもとに数秒のサンプルを作らせる、サンプルがうまくいったらGrill with Docsで設計を固める、設計に基づいて実装する、使いながら改善していくという手順で音声の動画化にチャレンジしてみてください。
概要欄にも今回の内容を解説した記事を貼っておきます。
最後に1つお知らせです。
点票作成、受発中管理、請求書などの業務はAIで自動化してコストを削減できます。
ITエンジニア歴10年の僕が現場の課題を聞き、システム開発から運用まで対応可能です。
相談は無料なので、概要欄のリンクからお問い合わせください。
AIを実務で使いこなせるようになりたい、といったご要望にも対応可能です。
それでは今日はこの辺で。
コメント
スクロール