Google、話すAIアバター「Live Avatar」を企業向けに一般提供開始

画像の出典:Google
多くの企業が顧客対応の自動化を模索する中、テキストや音声だけでなく、視覚的な対話体験を提供するAIの活用が注目されています。Googleは9月24日、リアルタイム音声対話モデル「Gemini 3.8 Live」に、発話内容と口の動きを同期させる動画アバター機能「Live Avatar」を実装し、企業向けGemini Enterpriseでの一般提供を開始しました。
本記事では、この新機能の技術的特徴や導入コスト、企業が独自アバターを作成する際の条件について詳しく解説します。
リアルタイム対話を実現するLive Avatarの技術的特徴
音声と映像が同期する自然な対話体験
Live Avatarは、Gemini 3.8 Liveの高度な音声対話能力をベースに、生成される音声に合わせてアバターの表情や口の動きをリアルタイムで同期させる技術です。従来のAIチャットボットとは異なり、カメラ映像や画面共有の内容をAIが同時に理解し、会話を継続しながら裏側でツールやAPI(外部プログラムとの連携窓口)を呼び出すことが可能です。これにより、単なる応答だけでなく、顧客の状況に応じた具体的なアクションを伴う対話が実現します。
多言語対応と柔軟な言語切り替え
本機能は97言語に対応しており、グローバル展開する企業にとっても利便性が高い設計となっています。会話の途中で言語を切り替えても、アバターの口の動きと表情がそのまま追従します。これにより、ユーザーは言語の壁を感じることなく、自然な対話体験を享受できます。また、生成される音声と映像には、AIによる生成物であることを示す電子透かし「SynthID」が自動的に付与され、信頼性と透明性の確保が図られています。
独自アバター作成と導入の仕組み
独自アバター作成の制限と審査
Googleは、あらかじめ用意されたアバターを選択して利用できるほか、参照画像1枚から独自のアバターを作成する機能も提供しています。ただし、独自アバターの作成は誰でも使えるわけではなく、Googleの審査を通って許可リスト(allowlist)に登録された企業に限られます。Googleは理由を「本人らしさを守り、悪用を防ぐため」と説明しています。許可リストへの登録は、Google Cloudの営業担当者を通じて相談する形です。
課金体系と導入事例
Google Cloudの料金ページによると、料金は使った分だけの従量課金です。アバター映像の出力は100万トークンあたり1ドルで、映像は1秒あたり6,192トークンとして換算されます。映像の料金がかかるのはアバターが話している間だけで、ユーザーの話を聞いている間は課金されません(音声やテキストの入出力は別料金)。導入例として、米Cox Automotiveが車の売買サイト「Autotrader」の買い物アシスタントに採用し、車の検索・比較・ローンの検討を会話で案内しています。なお、現時点でのエンドポイント(接続先)は米国とEUのリージョンに限られています。
企業導入に向けた検討事項
既存システムとの連携と運用
Live Avatarの導入を検討する企業にとって、既存の業務フローやシステムとの連携は重要なポイントです。Gemini 3.8 LiveはAPIを通じて外部ツールを呼び出せるため、CRM(顧客関係管理システム)や在庫管理システムと連携させることで、よりパーソナライズされた対話が可能になります。一方、接続先(エンドポイント)は米国とEUのみで、発表に日本の記載はありません。データを処理する場所を社内規程で決めている企業は、この条件に合うかどうかが最初の確認点になります。
セキュリティとガバナンス
Live Avatarが生成する音声と映像には、すべて目に見えない電子透かし「SynthID」が入ります。後から「AIが作った映像かどうか」を確かめられるようにするためです。また、Googleによるとデータの取り扱いは企業向けの管理基準(コンプライアンス・データガバナンス)に沿って提供されます。実在の人物に似せたアバターを作れるのは審査を通った企業だけという線引きも、なりすまし対策の一部です。
まとめ
- Googleがリアルタイム対話モデル「Gemini 3.8 Live」に動画アバター機能「Live Avatar」を実装し、企業向けに一般提供を開始しました。
- 発話内容と口の動きを同期させ、97言語に対応。会話中に言語を切り替えても自然な映像を生成します。
- 料金はアバターが話している時間のみ課金され、100万トークンあたり1ドル(1秒=6,192トークン換算)です。
- 独自アバター作成にはGoogleによる審査と許可リストへの登録が必要であり、現時点でのエンドポイントは米国とEUに限定されています。
- あわせて、会話中に裏でツールやAPIを呼び出す機能や、カメラ映像・画面共有を理解する機能も使えます。
💡 編集部の見解
Googleが、話す内容に合わせて口と表情が動くAIアバターを、企業向けのGemini Enterpriseで使える状態にしました。顧客対応や操作案内を、画面の中で話す人物に任せる用途を想定しています。
- 独自アバターは審査制:国内の一部報道は「画像1枚で独自アバターを作れる」と伝えていますが、Googleの発表では独自アバターの作成は審査を通った許可リストの企業に限られます。すぐに使えるのは用意済みのアバターです。
- 接続先は米国とEU:接続先は米国とEUのみで、発表に日本の記載はありません。データを処理する場所に社内ルールがある企業は、ここが最初の確認点になります。
出典:Google/Google/Google(2026年9月)




