YouTube用の解説アニメに、AIで効果音をつけました。フリー素材を探してきたのではなく、「ポン」「カチッ」「ぴょーん」といった音そのものを、AIにプログラムで一から作ってもらっています。最終的にできた音は98種類です。やってみてわかったのは、AIで効果音を作るときに一番大事なのは、作ることではなく「どこに、どの音をつけるか」を自分で選べる仕組みを用意することでした。この記事では、効果音をAIで作って動画に入れるまでの流れを、実際の画面と一緒に書いていきます。

AIで効果音を作ろうと思ったきっかけ
最近、komichi-logのYouTubeチャンネル用に、1分前後の解説アニメを作っています。ペンギンのキャラクターが歩いたり跳ねたりしながら、「努力のタイミング」や「ニュースレター配信システムの紹介」といったテーマを説明する動画です。アニメーションそのものはAIと一緒にHTML(ウェブページを作るための言語)で組み立てていて、文字やカードが画面に出てくる動きもすべてプログラムで書いています。
何本か作ったところで、物足りなさを感じました。カードがポンと出ても、ペンギンがジャンプしても、無音なんです。セリフの音声は入れていましたが、画面の中で物が動く瞬間に音がないと、どうしても平坦に見えます。そこでAIにお願いしたのが、この一言でした。
「音をつけたい セリフではなく 書く部品の動きの音SEみたいな」
SE(エスイー)はサウンドエフェクト、つまり効果音のことです。ふつうなら、ここからフリー素材のサイトを回って音を集めることになります。でも今回は、AIの提案で、音そのものを合成する方法をとりました。
フリー素材を探さなかった理由
フリー素材の効果音サイトはたくさんあって、質の高い音も無料で手に入ります。それでも今回使わなかったのには、2つ理由があります。
1つ目は、探す時間です。「カードが出る音」ひとつをとっても、ポン、ぽこっ、シュッと候補はいくらでもあります。サイトで試聴して、ダウンロードして、動画に当ててみて、合わなければまた探す。これを場面の数だけくり返すと、アニメを作るより音を探す時間のほうが長くなりそうでした。
2つ目は、使っていい条件の確認です。フリー素材と一口に言っても、クレジット表記が必要なもの、商用利用に条件があるもの、YouTubeの収益化で扱いが違うものなど、サイトや音ごとにルールがあります。チャンネルを育てていくつもりなら、1本ごとに確認して記録しておく必要があります。
AIに音そのものを作ってもらえば、この2つがまとめて片づきます。音の元になる素材を借りていないので、権利の心配がありません。足りない音は、その場で作ってもらえます。
AIはどうやって効果音を作ったのか
効果音といっても、録音したわけではありません。AIがPython(パイソン。プログラミング言語のひとつ)で、音の波を計算して作っています。
たとえば「ポン」は、高い音から低い音へ一瞬で下がる短い音として作られています。「カチッ」は、ごく短いノイズ(ザーッという雑音)の一部だけを切り出した音です。「ぴょーん」は、音の高さがびよーんと揺れながら変わっていく音。こうした音の「設計図」をプログラムに書いておき、実行すると音声ファイルがまとめてできあがる仕組みです。
私自身は、音の波の計算はまったくわかりません。やったことは、「こういう場面に、こういう感じの音がほしい」と言葉で伝えることだけです。そこからAIが音を作り、私が聞いて判断する、という役割分担になりました。
最初にできた音は13種類でした。ここまでは「AIってすごいな」で終わる話なのですが、本当に大事だったのはこの後でした。
「精査できるようにしてほしい」から生まれた効果音スタジオ
最初の版では、AIが「この場面にはこの音」と自動で割り当てた状態で動画ができあがっていました。再生してみると、いい音もあるけれど、場面に合わない音や、単純に好みではない音も混ざっています。そこで、次のようにお願いしました。
「おと気に入らないものもあるのでどこにどんな音を採用するか精査できるようにしてほしい」
これを受けてAIが作ってくれたのが、「効果音スタジオ」という編集画面です。動画のプレビューの横に、その動画で鳴っている音の一覧が並びます。

一覧の1行が、1つの音です。左から順に、使うかどうかのチェック、鳴らす時刻、場面の説明、使う音、音量、音の高さ、と並んでいます。右端のボタンを押すと、その音だけを鳴らしたり、少し前から動画を再生して前後の流れの中で聞いたりできます。
画面の上には「聞きくらべ」の欄があり、作った音がすべてボタンで並んでいます。押すとその場で鳴るので、気になる音を順番に聞いて、良いものがあれば一覧の行に設定する、という使い方です。
選び終わったら「保存」を押すと、その動画用の設定ファイルに書き込まれます。保存するたびに、それまでの設定が日時つきで別の場所に残るので、「前のほうがよかった」と思ったときも戻れます。
選択肢が少ないと、選ぶ意味がない
効果音スタジオで実際に選び始めると、すぐに次の壁にぶつかりました。候補の数が足りないんです。「この場面には、もっとやわらかい音がいい」と思っても、近い音が2〜3個しかないと、結局どれも決め手に欠けます。
「音のバリエーション増やせますか?選択肢が少なくていい音が見つけられません」
こうお願いすると、AIは楽器っぽい音や身近な物の音を中心に、一気に種類を増やしてくれました。マリンバの「ポロン」、木を叩く「コン」、紙をめくる「ぺらっ」、判子の「ポンッ」といった具合です。
さらに、具体的な場面ごとにも注文を出しました。グラフのバーが伸びる場面とメーターの場面には「バーとかメーターの音調整して欲しい」。金額の数字がカウントアップしていく場面には「お金の部分で数字が変わっているタイミングにも音を出したい」。ゲージがたまる場面には「ゲージの音、も少しバリエーションが欲しい」。その結果、ゲージがたまる音だけで「たまる」「たまる 水」「たまる 8bit」など何種類も並ぶようになりました。
こうして増えていった音は、最終的に98種類になりました。ジャンル別に「出てくる」「足音」「ジャンプ」「場面転換」「書く」「お金」「ゲージ」などと分けて並べてもらったので、目当ての音にたどり着くのも楽です。
振り返ると、ここが効果音作りでいちばん大事なポイントだったと思います。AIに音を作ってもらうこと自体は一瞬です。でも、選ぶ人の手元に十分な候補がなければ、「選べる」とは言えません。
選ぶときにやった3つの工夫
候補がそろってから、実際に音を選んでいくときに意識したことを3つ書いておきます。
1. 同じ音でも「高さ」を変える
積み木が1個ずつ積み上がっていく場面では、4つとも同じ「コン(木)」の音を使いました。ただし、音の高さを1個目から順に少しずつ上げています。1.00倍、1.12倍、1.24倍、1.36倍という具合です。こうすると、同じ音なのに「積み上がっていく感じ」が耳でもわかります。

2. 使わない場所は、あえて音なしにする
字幕の大事な言葉に、蛍光ペンで線を引くような演出を入れています。最初はここにも、線を引くたびに「ポン」や「カチッ」が鳴るように割り当てられていました。効果音スタジオで1つずつ聞いていくなかで、ここは音がないほうがいいと判断して、次のルールに決めました。
「今後は蛍光ペンの部分は音無しでOKです」
効果音は、たくさん鳴らせばにぎやかになるわけではありません。効果音スタジオでは、行の左のチェックを外すだけでその音を鳴らさないようにできるので、「足す」と同じくらい「引く」も気軽に試せました。

3. 音に「役割の名前」をつける
音が確定したところで、AIにもうひとつお願いをしました。
「どの音を何の音として使っているか認識して名前を書き換えれますか?」
それまでの音の名前は、「pop」「boing」のような作ったときの呼び名でした。これを「★ペンギンの足音|ちょこん」「★ジャンプ・場面転換|ぴょーん」のように、何の場面で使う音なのかがわかる名前に変えてもらいました。おかげで、次の動画を作るときも「ジャンプにはいつもの音」とすぐ選べます。動画ごとに音がバラバラにならず、チャンネル全体で音の雰囲気がそろうのもうれしいポイントでした。
仕上げはAIにおまかせ。声の間は効果音を少し下げる
選び終わった音を動画に重ねるところは、AIが作った書き出しの仕組みにまかせています。ここで1つ、聞きやすさのための工夫が入っています。セリフが流れている間だけ、効果音の音量を55%まで下げているんです。
こうした処理は「ダッキング」と呼ばれます。声と効果音が同じ大きさでぶつかると、肝心のセリフが聞き取りにくくなります。セリフの間だけ効果音をすっと下げて、セリフが終わったらまた元に戻す。下げ始めと戻すときにも少し時間をかけて、音量がぶつっと切り替わらないようにしてあります。
ここは私が選ぶ部分ではなく、「聞きやすくしてほしい」という目的だけ伝えて、やり方はAIに任せたところです。自分が判断したいところと、任せてしまっていいところを分けておくと、作業がぐっと楽になります。
作るのはAI、選ぶのは自分
最初に「音をつけたい」とお願いしてから、「音はこれで確定でOKです!」と伝えるまで、やりとりの記録を見返すと、かかった時間はおよそ1時間でした。フリー素材を1つずつ探していたら、とてもこの時間では終わらなかったと思います。
ただ、早く終わった一番の理由は、AIが音を作るのが速かったからではありません。「気に入らない音がある」「選択肢が少ない」「蛍光ペンはうるさい」と、自分が感じた違和感をその都度伝えて、それを直せる仕組みがあったからです。AIは何十種類でも音を作ってくれますが、どれが自分の動画に合うかは、自分の耳で聞いて決めるしかありません。
このブログでも何度か書いていますが、AIとものを作るときの私の考え方は、AIの記事が薄いのは指示書の設計のせいだった話のころから変わっていません。AIに丸投げするのではなく、判断する場所を人の側に残しておくこと。今回の効果音作りは、それがいちばんわかりやすく形になった例でした。
この「AIが作って、こみちが選ぶ」流れは、1分ちょっとの解説アニメにもまとめました。ヘッドホンをつけたペンギンが、効果音スタジオで音を聞きくらべている動画です。YouTubeで公開したら、こちらでも紹介します。
ちなみに、効果音のあとはBGMもAIに作ってもらいました。BGMは効果音より権利の扱いが気になったので、YouTubeにいったん非公開でアップして、Content ID(YouTubeが登録済みの音楽と自動で照らし合わせる仕組み)のチェックを通してから使っています。Content IDのしくみはYouTubeヘルプの説明ページにまとまっています。
よくある質問
Q. 音楽や音の知識がなくても、AIで効果音は作れますか?
A. 作れます。私も音の波の計算はまったくわかりません。「カードが出る、軽い音」「ゲージがたまる音のバリエーション」のように、場面と雰囲気を言葉で伝えるだけで十分でした。大事なのは、できた音を自分で聞いて「これは違う」と言えることです。
Q. AIで作った効果音は、著作権の心配はありませんか?
A. 今回の効果音は、録音や既存の素材を使わず、プログラムで音の波を計算して作っています。借りてきた素材が入っていないので、その意味での心配はありません。ただ、誰かの作品にわざと似せて作った場合などは話が別なので、そういう使い方はしないようにしています。
Q. 効果音は何種類くらいあれば足りますか?
A. 私の場合、最初の13種類では「選べない」と感じ、最終的に98種類まで増やしました。実際に1本の動画で使うのはその一部ですが、1つの場面に対して3〜5個くらい候補があると、選ぶのが楽しくなります。
Q. AIに選ぶところまで任せてはだめですか?
A. 最初はAIに自動で割り当ててもらいましたが、気に入らない音がいくつも混ざりました。音の好みや「ここは静かにしたい」という判断は、作っている本人にしかわかりません。AIには候補を出してもらい、決めるのは自分、という分担がおすすめです。
まとめ:AIで効果音を作るなら、選ぶ仕組みまでセットで
解説アニメの効果音を、AIで一から作った話を書いてきました。やったことを並べると、次のとおりです。
- フリー素材を探す代わりに、AIにプログラムで効果音を作ってもらった
- 「精査できるようにしてほしい」とお願いして、音を選ぶ編集画面(効果音スタジオ)を作ってもらった
- 選択肢が足りなかったので、場面ごとに注文を出して98種類まで増やした
- 高さを変える・あえて音なしにする・役割の名前をつける、の3つを工夫した
- セリフの間は効果音を下げる処理は、AIに任せた
AIで効果音を作るのは、思っていたよりずっと手軽でした。でも、動画が「自分の動画」らしくなったのは、どの音をどこで鳴らすかを、1つずつ自分の耳で選んだからだと思います。作るのはAI、選ぶのは自分。この分担は、効果音以外のものづくりにもそのまま使えそうです。
AIとの付き合い方については、claudeと出会ったころの話や、ブログ更新をまるごと自動化してみた話にも書いています。よかったら、X(旧Twitter)やInstagramのフォローで、ゆるっと続きをのぞいてもらえたら嬉しいです。
コメント