#人工智能 谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,重点提升实时转写准确率、降低延迟和提高多语言能力等。该模型不仅可以将语音转为文本,还会理解说话者的意图并对结果进行自动整理和格式化。目前该模型已经通过 Gemini API 进行公共预览,开发者可以在控制台进行调用。查看全文:https://ourl.co/126490
谷歌日前宣布推出 Gemini 3.5 Transcribe 模型,该模型是谷歌最新研发的语音转文字模型,重点提升实时转写准确率、降低延迟和提高多语言能力等。与传统语音识别不同的是,该模型不仅负责将语音转换为文字,还会理解说话者的意图并对结果进行自动整理和格式化。
Gemini 3.5 Transcribe 可以自动处理停顿、自我纠正和口头语。例如用户说「明天见 --- 不,改成后天」,模型会直接输出修正后的最终内容,同时自动去除嗯啊等无实际意义的填充词。用户还可以提供自定义词汇表,让模型识别产品名称、专业术语和特殊拼写,减少技术会议、医疗和企业客服等场景中的转写错误。
模型支持自动识别和转写超过 85 种语言,针对地区口音和方言进行优化,处理预录音频时还可以区分最多 3 名说话者并标注发言归属,同时提供单词级别的时间戳;超过 3 名说话者目前处于实验性支持阶段。
Gemini 3.5 Transcribe 提供实时模式 API 和预录制模式 API,前者通过 Live API 持续进行双向流式转写,延迟低于 1 秒。后者主要面向会议录音、电话记录和其他预录制音频的转文字能力。
谷歌称该模型实时转写平均词错误率仅为 4%,非实时模式错误率仅 2.6%,最终转写结果生成时间要比此前的语音转文本模型缩短 70%。
目前该模型已经面向开发者通过 Gemini API 平台进行公共预览,Gemini for macOS 版用户也可以使用该模型,在 Gemini for macOS 版中用户可以直接通过语音要求 AI 分析本地文件、改写文本和生成图片等。
谷歌也确认未来该功能将支持 Chrome 浏览器,到时候用户可以直接在网页输入框中使用自然语音完成文本内容的输入和编辑。





