【速報】Googleが音声特化モデル「Gemini 3.5 Transcribe」を発表!超低遅延ストリーミングと高精度な話者分離を実現

AI

🎙️【超速報】Googleが音声特化AI「Gemini 3.5 Transcribe」を発表!超低遅延ストリーミングと高精度な話者分離を実現

Google AI Studioから本日、音声認識と文字起こしに特化した新モデル「Gemini 3.5 Transcribe」のリリースが発表されました。

本モデルは、生の音声データをただテキスト化するだけでなく、文脈を理解しながら高精度なデータへと変換するために設計されています。対話型の音声エージェント、リアルタイム字幕ツール、通話後のデータ分析など、「音声ファースト」なシステムを開発するエンジニアにとって待望のアップデートです。

✨ 1. 用途に合わせて選べる2つの強力なAPI

今回のリリースでは、リアルタイム処理とバッチ処理、それぞれのユースケースに最適化された2つのモデルが提供されています。

  • リアルタイムストリーミング(gemini-3.5-transcribe-live Live APIを介して、1秒未満の超低遅延(サブセカンド・レイテンシ)で双方向のストリーミング処理を提供します。対話型のAIエージェントや、ライブ配信のリアルタイム字幕システムに最適です。

  • 録音済み音声のバッチ処理(gemini-3.5-transcribe Interactions APIを使用し、1回のリクエストで最大1時間までの音声ファイルを処理できます。最大3名までの高精度な「話者分離(Diarization)」に対応し、単語レベルでのタイムスタンプ取得も可能です。

🚀 2. 開発者の前処理をなくす「スマート文字起こし」

取得したテキストデータをWebアプリケーションや自動化システムに組み込む際の手間を、大幅に削減する画期的な機能が備わっています。

💡 スマート文字起こしモード(Smart transcription mode) 「えーっと」「あー」などのフィラー(意味のない言葉)や言い淀みを自動的にフィルタリング。さらに、音声で読み上げられた日付や数字などを、後続のLLM(大規模言語モデル)やシステムが処理しやすい綺麗なテキスト形式に自動整形してくれます。

さらに、専門用語、業界特有の略語、独自の製品名などを最大1,000語までカスタムリストとして登録(Custom vocabulary)でき、85以上の言語と方言を自動検出してグローバルにサポートします。

💻 3. Python SDKによる公式実装サンプル

Gemini 3.5 Transcribeは、Python、JavaScript、Go用の最新SDK、およびDirect REST API(cURL)からすでに利用可能です。以下はPythonを用いた、話者分離と単語タイムスタンプを取得する実装例です。

Python

from google import genai

client = genai.Client()

# Files API経由でローカルの音声ファイルをアップロード
audio_file = client.files.upload(file="path/to/audio.wav")

# 話者分離と単語タイムスタンプを指定して文字起こしを実行
interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[{
        "type": "audio",
        "uri": audio_file.uri,
        "mime_type": audio_file.mime_type,
    }],
    generation_config={
        "transcription_config": {
            "language_codes": ["en-US"],
            "custom_vocabulary": ["Gemini", "Transcribe"],
            "mode": {
                "type": "verbatim",
                "diarization_mode": "speaker",
                "timestamp_granularities": ["word"],
            }
        }
    }
)

print(interaction.output_text)

🌐 4. まとめ:バックエンド連携のハードルが劇的に低下

Gemini 3.5 Transcribeの登場により、これまで開発者を悩ませていた「音声データのノイズ除去」や「話者の特定」といった複雑な前処理が、API側で完全に完結するようになりました。

特筆すべきは、出力されるテキストが最初から整形されている点です。これにより、取得した文字起こしデータをPythonやPHP、JavaScriptなどで構築された既存のWebシステムや、自動コンテンツ生成のバックエンド処理へスムーズに連携させることが可能になります。

APIを活用した自動化ワークフローや、独自の音声AIツールを開発するスピードが、今後さらに加速していくことは間違いありません。

タイトルとURLをコピーしました