Google近日发布 Gemini 系列最新语音转文字模型 Gemini 3.5 Transcribe,并称其为目前该系列中准确度最高的语音识别模型。该模型面向开发者、企业及普通用户开放,重点提升了嘈杂环境、复杂专业术语以及自然口语表达下的转写能力。

据介绍,Gemini 3.5 Transcribe 能够更好地处理背景噪声和专业领域中的复杂词汇。Google表示,新模型已为 macOS 平台的 Gemini 应用,以及 Android 平台 Gboard 键盘的 Rambler 功能带来性能改进。开发者则可借助该模型构建语音智能体、实时字幕工具及通话后分析流程等应用。
Google称,Gemini 3.5 Transcribe 旨在捕捉用户自然的说话方式,从而更准确地理解语义意图、识别自定义词汇,并帮助用户通过语音完成任务。
在功能层面,新模型加入了多项优化能力,包括自动自我修正、删除“嗯”“啊”等口语填充词,以及对输出文本进行自动格式化。同时,它还能将文件分析、图像生成等较复杂任务委派给其他 Gemini 模型处理,形成更完整的多模型协作体验。
准确率方面,Google指出,Gemini 3.5 Transcribe 在流式语音识别场景中的平均词错误率为 4.0%,在非流式场景中则可降至 2.6%。该模型在噪声较多的环境中具备更好的转写表现,并能够更准确地识别订单编号、邮政编码等由字母和数字组成的关键信息。

语言支持方面,Gemini 3.5 Transcribe 目前覆盖 85 种语言,并支持地区口音和不同方言。对于预先录制的音频,它可为最多三名说话者进行带时间戳的语音归属识别;此外,模型还能适应用户自定义的词汇表,识别专业术语、特殊拼写及行业专有名称。
目前,开发者可通过 Google AI Studio 和 Google Antigravity 中的 Gemini API,以公开预览形式使用 Gemini 3.5 Transcribe。普通用户则可在 Android 和 macOS 平台体验相关功能。Google还计划将其引入 Chrome 浏览器,届时用户可在任意网页输入框中直接通过语音输入文字。
近期,Google持续加快 Gemini 产品线的推进节奏。公司此前推出 Gemini 3.7 Flash,加入日益激烈的 AI 模型价格竞争;Gemini in Chrome for Android 也已向美国所有用户开放,Gemini 助手还进入了 Waymo 的新一代自动驾驶出租车。

