Google AI StudioおよびGoogle Cloudから、リアルタイムな音声対話とマルチモーダル処理に特化した新モデル「Gemini 3.8 Live」が正式発表されました。
本モデルは、超低遅延な音声対話に加えて、動画や画像のリアルタイム解析、外部ツールの非同期実行などを実現。音声AIエージェントや次世代の対話型アプリケーション開発を大きく加速させる注目のアップデートとなっています。
🚀 1. 2つのモデルが同時リリース
今回の発表では、用途や処理の複雑さに応じて選択できる2つのモデルが用意されています。
-
Gemini 3.8 Live
応答の速さ(低遅延)とコストパフォーマンスを最重視して設計された標準モデルです。自然なスピードでの会話が必要な音声エージェントやカスタマーサポートAIに最適です。
-
Gemini 3.8 Live Extended Thinking
「考えながら話す」ことができる上位モデルです。複雑な計算、複数ステップの計画、推論が必要なタスクに対応しており、AIが思考している最中もその進捗状況をリアルタイムに音声で説明してくれます。
✨ 2. 主な進化ポイント
① マルチモーダル入力&カメラ動画のリアルタイム解析
音声による問いかけだけでなく、テキスト、画像、さらにはスマートフォンのカメラ等を通じたリアルタイムの動画映像を入力として受け取ることができます。目の前にある物体や操作画面をカメラで見せながら、音声で対話・指示を出すシステムが容易に構築可能になります。
② 会話を途切れさせない「非同期ツール実行」
ユーザーと会話を継続しながら、バックグラウンドで外部APIやデータベース検索などのツールを実行する処理が大幅に強化されました。処理の完了を待って会話が中断されることがなく、極めて自然な会話体験が維持されます。
③ 97言語を自動識別・グローバル対応
自動的に言語を判別し、97以上の言語でシームレスな音声対話が可能です。多言語に対応した案内ロボットや学習ツールへの組み込みもスムーズに行えます。
💰 3. API利用料金の目安
Gemini APIおよびGoogle AI Studioにおいて、すでに利用可能となっています。発表された音声処理の概算コストは以下の通りです。
| 項目 | 料金目安 | 備考 |
| 音声入力(Input) | 約 $0.005 / 分 | ユーザーの音声入力・ストリーミング |
| 音声出力(Output) | 約 $0.018 / 分 | AIによる音声レスポンス生成 |
※従来のモデルと比べても非常にコスト効率が高く、長時間のストリーミングセッションでも費用を抑えて運用できます。
🌐 4. まとめ:音声AIエージェント開発の新時代へ
Gemini 3.8 Liveの登場により、「画面をタップしてテキストを入力する」インターフェースから、「カメラで見せながら音声で対話する」高度な音声エージェントへの移行が現実的になりました。
特に、推論プロセスを音声で可視化する「Extended Thinking」や、裏で処理を走らせながら会話を続ける非同期連携は、学習支援ツールや業務自動化エージェントなど、幅広い分野での活用が期待されます。

