昨天,我們在 Gemini API 與 Google AI Studio 發布了全新的 Gemini Live 模型,擴展我們用於打造即時、以語音為先的產品體驗的開發者套件:
Gemini 3.8 Live 與 3.8 Live Extended Thinking:Gemini 3.8 Live 為我們原生的語音轉語音模型帶來了跨越式提升,能在維持對話的同時執行任務。對於複雜請求,3.8 Live Extended Thinking 可提供更深層的推理,在 Artificial Analysis 的 Speech-to-Speech 排行榜中名列第 1。
Gemini 3.5 Transcribe:我們專用的語音轉文字模型,能在 85 種以上語言中提供高精準度轉錄。此模型於上月發布,平均字錯誤率(WER)達到 4.0%(串流)與 2.6%(非串流)。
我們的新模型,Gemini 3.8 Live 與 3.8 Live Extended Thinking,可讓開發者打造能在維持對話流暢度的同時進行推理並執行任務的語音代理程式。主要能力包括:
3.8 Live Extended Thinking 也支援可設定的思考,可在背景處理複雜的多步驟推理,同時在主對話中回應或敘述其進度。這些模型相較於我們先前的 Live 模型,是一次跨越式升級,並提供了比級聯式架構更精簡的替代方案。

Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 可透過 Live API 使用。它們具備具競爭力的價格:音訊輸入每分鐘 0.005 美元、音訊輸出每分鐘 0.018 美元*,讓開發者能以業界領先的效能擴展語音應用程式。

開發者也可以透過 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 存取這些模型;這些都是我們的 Live API 整合夥伴,負責處理實際部署所需的媒體串流基礎架構。

即時語音理解對於以語音為先的介面至關重要。上個月,我們發布了 Gemini 3.5 Transcribe,提供低延遲、高精準度的轉錄,並具備以下實用功能:
custom_vocabulary 清單,引導語音辨識更傾向領域專有名詞、罕見術語、公司名稱與專有名詞 3.5 Transcribe 支援 85 種以上語言,並為語音體驗與無狀態任務提供強大的聽辨引擎,例如秒級字幕、客服中心代理程式與即時音訊分析。你也可以透過 Interactions API 存取此模型,將長度最長 1 小時的音訊檔轉錄為包含結構化時間戳記與說話者標記的內容。請閱讀我們的 開發者指南 以了解更多資訊。
若要開始使用,請前往 ai.studio/live 試用這些模型、從 GitHub 複製範例應用程式,或為你的代理程式配備我們的 Live API 技能。
你也可以使用我們的語音與音樂生成模型來打造音訊體驗,全部都可在 Gemini API 中使用:
麥克風交給你了,我們迫不及待想聽到你做出什麼!