声を聞き取る「音声認識」と、自然な声で話す「音声合成」の総称。議事録の自動化からAIとの音声会話まで、AIの「耳と口」を担う技術。
聞き取り側は会議の文字起こしでもう実用の定番。話す側も進化が著しく、数秒のサンプルから本人そっくりの声を作れるレベルに達しています。ChatGPTの音声会話モードのように「AIと自然に喋る」体験は、この耳と口の技術が支えています。
便利さと危うさが表裏一体で、声のクローンは詐欺への悪用が現実の問題になっています(ディープフェイクの項を参照)。「声も本人確認の証拠にならない時代」を前提に、家族間で合言葉を決めておく——そんな自衛策が真面目に推奨され始めています。
会議の文字起こしと要約、多言語ナレーションの生成、自分の声のクローン、AIとの音声会話などです。「議事録を取る係」はほぼAIの仕事になりました。
本人になりすます詐欺への悪用が実際に起きており、家族間で合言葉を決めるなどの自衛が推奨されています。無断の声の複製への規制も各国で進んでいます。
用語を覚えるより、ストーリーで体感するほうが早い。