AIが人の姿で受け答えする仕組み。声だけだったAIに顔と表情がつき、会話に合わせて口の動きや表情がリアルタイムで変わる。2026年9月にGoogleが企業向けの提供を始めた。
AIアバターは、AIの受け答えを声だけでなく「人の姿」で返す仕組みです。画面の向こうに人のような姿が映り、こちらが話すと口が動き、間の取り方や表情も会話に合わせて変わります。仕組みとしては、音声で対話するモデルに、ほぼリアルタイムで動画を生成する仕組みを重ねたもの。あらかじめ用意された姿から選ぶほか、1枚の画像から自社のキャラクターを作れる形も出てきました。
2026年9月24日、GoogleがリアルタイムAI「Gemini 3.8 Live」に「Live Avatar」を加え、企業向けのGemini Enterpriseで一般提供を始めました。97の言語に対応し、日本語も含まれます。会話の途中で言語が切り替わっても、口の動きと表情がずれずに追従するのが特徴です。生成した音声と映像にはSynthIDという目に見えない電子透かしが入り、AIが作ったものだとあとから確かめられるようにしてあります。
違いは「待たせない」ことです。動画生成AIで人が話す映像を作ること自体は以前からできましたが、それは数十秒の映像を時間をかけて作る作業でした。AIアバターは会話しながら映像を作るので、こちらの質問に間を置かずに顔が反応します。さらに、裏で調べものや手続きを進めながら会話を続けられる作りになっていて、「少々お待ちください」と黙り込まない点も、実務では大きな違いです。
想定されている用途は、問い合わせ対応、操作の案内、多言語の受付など。声だけでは伝わりにくい頷きや間が入るぶん、案内役としては分かりやすくなります。反面、姿があるだけ期待値も上がるため、答えを間違えたときの落差は大きくなります。
ここが最大の論点です。人の姿で自然に話すAIは、ディープフェイクと技術的には地続きにあります。だからGoogleは、生成した音声と映像にSynthIDという電子透かしを埋め込み、AI生成かどうかを機械的に確かめられるようにしています。また、自社ブランドのアバターを新しく作る機能は、承認された企業だけに限る運用になっています。
使う側・見る側の心得は単純で、「画面の向こうの人らしさ」を信用の根拠にしないことです。本人確認や金銭のやり取りは、顔が見えているかどうかとは別の手段で確かめる。AIアバターが広がるほど、「顔が見えるから安心」という直感のほうを更新しておく必要があります。
影響が出そうなのは、受付・一次対応・研修といった「決まった説明を、人が繰り返している」仕事です。24時間・多言語で同じ説明ができるので、問い合わせの一次受けや店頭の案内から置き換わっていくと見られます。とはいえ2026年9月時点の提供は企業向けが中心で、個人がすぐ使える機能ではありません。
いま効く準備は、自分の仕事のなかで「毎回同じ説明をしている部分」を洗い出しておくことです。そこが置き換わる候補であり、同時にAIに渡す原稿として整える価値がいちばん高い部分でもあります。人が残るのは例外への対応と、間違ったときの引き取り——この線引きを先に決めておくと、導入でつまずきません。
2026年9月時点では、Googleの「Live Avatar」は企業向けのGemini Enterpriseでの提供が中心で、個人向けには開放されていません。自社ブランドのアバターを新しく作る機能も、承認された企業に限られています。
技術としては地続きで、違いは使い方と表示です。AIアバターは「AIであること」を前提に提供され、生成した音声と映像にSynthIDのような電子透かしを入れて、あとから確かめられるようにしています。実在の人になりすます目的で作られるディープフェイクとは、そこが分かれ目です。
使えます。Live Avatarは97の言語に対応し、日本語も含まれます。会話の途中で言語が変わっても、口の動きと表情が追従する設計だと説明されています。
用語を覚えるより、ストーリーで体感するほうが早い。