3.8 Flash および 3.8 Cyber モデルの発表から数週間後、そして 3.5 Transcribe モデルの発表から 3 週間後、Google は新しい Gemini 3.8 Live および 3.8 Live Extended Thinking モデルを発表することにより、会話型人工知能セグメントにおける重要な前進を発表しました。
2 人の新参者は、音声対話を非常に流動的かつ自然にし、ユーザーの対話を中断することなく複雑なタスクをリアルタイムで処理できるエージェントを強化するように設計されています。 3.5 Transcribe および以前に発表された他のテンプレートと合わせて、新しいテンプレートは、開発者が最先端のリアルタイム音声アプリケーションを作成するための決定的なスイートを構成します。すべての詳細を調べてみましょう。
Google Discover で Apple Geek LABO をフォローする
Googleが2つの新しい会話型AIモデルを発表
当初の予想通り、Google は公式ブログへの投稿を通じて、「これまでで最も先進的なライブ対話モデル」と定義される新しい会話型 AI モデル Gemini 3.8 Live および Gemini 3.8 Live Extended Thinking を発表しました。
これらの新しいモデルは、Flash シリーズ モデルに典型的なコスト/パフォーマンス比を差し引くと、インテリジェンスと並列推論の点で重要な改善を誇り、信頼できる音声エージェントの理想的な基盤となります。
ジェミニ 3.8 ライブ
新しい Gemini 3.8 Live は、高い操作効率と自然な対話を提供するために開発されました。会話型インテリジェンスと視覚的なコンテキストの理解と、リアルタイムの入力処理、および 97 の異なる言語とアクセントの自動認識 (およびそれらすべての間の動的な切り替え) が組み合わされています。
このモデルの特徴の 1 つは、ツールを非同期に実行し、バックグラウンドで API を呼び出す機能です。このおかげで、セッション外で操作を完了しながら、ユーザーとの会話や対話を続けることができます。
例1
Gemini 3.8 Live は、視覚的なコンテキストを使用してリアルタイムで質問に答え、新入社員のオンボーディングをリアルタイムでガイドします。
例 2
Gemini 3.8 の視覚的なコンテキスト、推論、自然な会話の流れを活用して、ほぼリアルタイムでチェスをライブプレイする様子をご覧ください。
Gemini 3.8 拡張思考を実践する
ただし、非常に複雑なタスクのために、Google は Gemini 3.8 拡張思考を実践する、音声の流動性を維持しながら高度な多段階推論を実行するように設計されたモデル。
このモデルの特徴は、同時処理と音声合成を組み合わせる能力です。バックグラウンドでの推論と処理中に沈黙を保つ代わりに、人間が「自発的な」文章 (たとえば、「確認させてください」) を話すのと同じように時間がかかります。
このアプローチにより、コード生成からインターフェース作成、ドラフト、ビジネス計画まで、複雑なワークフローをモデルがガイドできるようになります。
例1
Gemini 3.8 Live Extended Thinking がラフ スケッチとほぼリアルタイムの音声フィードバックを機能的な React コンポーネントに変換する様子をご覧ください。
例 2
Gemini 3.8 Live が自然言語を使用して、包括的なビジネス プランとカスタマイズされたマーケティング ツールキットをリアルタイムで作成する様子をご覧ください。
新モデルの性能
性能的にはこのモデルは ジェミニ 3.8 ライブ で2位になりました スピーチエージェントアリーナ (プラットフォームは実際の会話で音声対音声 AI モデルを比較します)、英数字データ (検証コードやケース番号など) の処理において高い精度を示します。
については Gemini 3.8 拡張思考を実践する、ベンチマークによってその有効性が確認されています。このモデルは、Artificial Analysis の Speech to Speech 品質指数で全体で 1 位を獲得し、代理店のタスクの完了において優れた結果を示しています。
新しいモデルの入手可能性
Google が発表した新しい会話型 AI モデルは、本日から開発者、企業、消費者ユーザー向けにすでに配布されています。
- ジェミニ 3.8 ライブ
- 開発者 – Gemini API および Google AI Studio
- Enterprise – Gemini Enterprise で近日公開予定 (プライベート プレビュー)
- 消費者ユーザー – ライブ検索 からの AIモード
- Gemini 3.8 拡張思考を実践する
- 開発者 – Gemini API および Google AI Studio
- エンタープライズ – Gemini Enterprise(プライベート プレビュー)、Gemini Enterprise for Customer Experience、および Google Workspace のお客様向けに近日提供予定
- 消費者ユーザー – すべてのユーザー向け ジェミニライブ、Google AI プランの加入者向け ライブを続ける そして ライブを続ける、Google AI Pro および AI Ultra プランの加入者向け ドキュメントライブ。
Telegram で Google をフォローして、ニュースやオファーを最初に受け取りましょう
更新された「Gemini Audio」スイートはすでに開発者に提供されています
新しいモデルについて ジェミニ 3.8 ライブ そして 3.8 拡張思考を実践する公式ブログの別の投稿で述べたように、Google は基本的に、開発者コミュニティが利用できる完全なスイートを提供しており、以下の機能も期待できます。
- Gemini 3.5 転写 (85以上の言語で動作可能な音声からテキストへのモデル)
- Gemini 3.5 ライブ翻訳 (6月発表、70以上の言語の音声翻訳モデルです)
- ルリア 3.5 (7月末発表、同社の最先端音楽生成モデル)
これらすべてのモデルは現在、Gemini API と Google AI Studio で利用可能であり、開発者は音声ベースの製品エクスペリエンスをリアルタイムで作成できます。つまり、支援やシャドウイング タスクを実行し、異なる言語を話す人々と対話することもできる一連のエージェント全体を作成できます。
