WaveNetとは
WaveNetとは、DeepMindが提案した深層生成モデルで、音声の生波形を1サンプルずつ予測して生成します。拡張畳み込み(Dilated Convolution)により長時間依存性を学習し、極めて自然な音声合成を実現しました。
この用語はG検定シラバスの「28. 音声処理」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。
一言でいうと
音の波形そのものを1点ずつ作り出す、自然な音声を生成するモデルです。
波形を直接作る
従来は音の特徴量を生成してから波形に変換していました。WaveNetは波形の数値そのものを1サンプルずつ予測します。
前の値から次の値を予測していく自己回帰型の生成であり、GPTが次の単語を予測するのと同じ発想です。
拡張畳み込みが鍵
音声は1秒間に数万サンプルあります。意味のある長さを扱うには非常に広い範囲を見る必要があります。
そこでDilated Convolutionを用い、層を重ねるごとに間隔を広げて受容野を指数的に拡大しました。少ない層数で長時間の依存を捉えられます。
生成速度の課題
1サンプルずつ順番に生成するため、そのままでは非常に低速でした。1秒の音声に数分かかることもありました。
その後、並列に生成できる改良版が開発され、実用的な速度が実現されています。
🎯 G検定での押さえどころ
- DeepMindが提案
- 生波形を1サンプルずつ予測して生成
- Dilated Convolutionで長時間依存を学習
⚠️ よくある誤りの選択肢
- 「WaveNetは音声の特徴量のみを生成する」→ 誤り。生波形を直接生成します
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。