Meta、リアルタイム対話型AIアバター技術「Muse Realtime Avatar」を披露

画像の出典:Meta AI Research
AIエージェントとの会話は、これまで文字か音声が中心でした。Metaは9月23日の開発者イベント「Meta Connect 2026」で、声に合わせて表情や身ぶりが動くアバター技術「Muse Realtime Avatar」を披露しました。
本記事では、その仕組みと性能、そして個人向けAIエージェント「Muse」でいつ使えるのかを解説します。
リアルタイム対話を実現する技術的背景
音声と映像を一体で生成する仕組み
Metaが開発した「Muse Realtime Avatar」は、音声モデル「Muse Realtime Voice」の出力を基に、表情や身ぶりを伴うアバター映像を生成します。最大の特徴は、声と映像のデータを同一のストリーム(データの流れ)として処理する点にあります。声を作るのと同じデータから映像も作るため、声・口の動き・表情の同期が保たれます。参照画像を活用することで、実写の顔写真であれば微細な表情の変化を、全身のイラストであれば身ぶりや姿勢の変化を伴った応答が可能です。動物や身の回りの物も、特徴を残したまま話すキャラクターにできます。
応答速度と計算効率の最適化
映像は448×768の縦長で毎秒25コマです。ユーザーが話し終えてから、声と映像の最初のデータが届くまでは約870ミリ秒(1秒弱)です。速さを出すため、Metaは元になった大きなモデルが1区切りあたり120回かける計算を、2回で済む小さなモデルに引き継がせました(60分の1)。さらにNVIDIAと協力して処理を最適化し、GPU「GB200」1基で、映像生成の会話12本を同時にこなせるとしています。
競合技術との比較と安全性への配慮
社内評価における優位性
Metaが実施した社内評価では、2〜3分間の対話を通じて「Runway Characters」や「HeyGen LiveAvatar」といった既存のAIアバター技術と比較検証が行われました。評価者は同じ見た目のアバターで比べ、画質、声と口の同期、キャラクターの一貫性、しぐさなどを採点しました。Metaによると、Muse Realtime Avatarは総合でも各項目でも好まれましたが、しぐさの自然さはRunway Charactersとの差がはっきりしなかったとしています。あくまでMeta自身が行った評価です。
電子透かしによる信頼性の担保
生成した映像には、目に見えない電子透かし「Meta Video Seal」が埋め込まれます。後から「AIが作った映像か」をたどれるようにするためで、リアルタイム性を損なわない方式だとしています。なお、Museアプリ自体は18歳以上向けのサービスです。
今後の展望とビジネスへの影響
Museアプリへの実装と提供時期
Metaは、同社のAIエージェント「Muse」において、まずはリアルタイム会話機能から本技術を導入する方針を示しています。ただし、現時点で具体的な提供時期や、企業が自社のサービスに組み込むための窓口(API)の提供にも触れていません。また、Meta自身も、ブログの例は技術の能力を示すもので、すべてがMuseで使えるアバターではないと明記しています。
同じ週にGoogleは企業向けに提供開始
同じ週の9月24日には、Googleも話すAIアバター「Live Avatar」を、企業向けのGemini Enterpriseで一般提供しました(Googleの発表)。Googleは企業が自社の窓口に組み込む形で、Metaは個人向けのMuseアプリに載せる形です。同じ「話すアバター」でも、使う人と提供の段階が違います。
関連記事:Google、話すAIアバター「Live Avatar」を企業向けに一般提供開始
💡 編集部の見解
Metaが、AIエージェント「Muse」に表情と身ぶりのある“顔”を付ける技術を披露しました。声と映像を同じデータから作るので、口の動きがずれにくいのが特徴です。
- まだ使えない:国内の一部紹介は「公開」と伝えていますが、Metaの発表は披露の段階で、Museで使える時期は示していません。ブログの例も、すべてがMuseで使えるアバターではないと明記されています。
- Googleとの違い:同じ週にGoogleは企業向けにLive Avatarを一般提供しました。Metaは個人向けのMuseに載せる計画で、企業が自社サービスに組み込む窓口(API)の話は今回ありません。
出典:Meta AI Research/AI at Meta(X)/Google




