谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力
2026-8-27 03:16:33 Author: www.landian.news(查看原文) 阅读量:5 收藏

#人工智能 谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,重点提升实时转写准确率、降低延迟和提高多语言能力等。该模型不仅可以将语音转为文本,还会理解说话者的意图并对结果进行自动整理和格式化。目前该模型已经通过 Gemini API 进行公共预览,开发者可以在控制台进行调用。查看全文:https://ourl.co/126490

谷歌日前宣布推出 Gemini 3.5 Transcribe 模型,该模型是谷歌最新研发的语音转文字模型,重点提升实时转写准确率、降低延迟和提高多语言能力等。与传统语音识别不同的是,该模型不仅负责将语音转换为文字,还会理解说话者的意图并对结果进行自动整理和格式化。

谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力

Gemini 3.5 Transcribe 可以自动处理停顿、自我纠正和口头语。例如用户说「明天见 --- 不,改成后天」,模型会直接输出修正后的最终内容,同时自动去除嗯啊等无实际意义的填充词。用户还可以提供自定义词汇表,让模型识别产品名称、专业术语和特殊拼写,减少技术会议、医疗和企业客服等场景中的转写错误。

模型支持自动识别和转写超过 85 种语言,针对地区口音和方言进行优化,处理预录音频时还可以区分最多 3 名说话者并标注发言归属,同时提供单词级别的时间戳;超过 3 名说话者目前处于实验性支持阶段。

Gemini 3.5 Transcribe 提供实时模式 API 和预录制模式 API,前者通过 Live API 持续进行双向流式转写,延迟低于 1 秒。后者主要面向会议录音、电话记录和其他预录制音频的转文字能力。

谷歌称该模型实时转写平均词错误率仅为 4%,非实时模式错误率仅 2.6%,最终转写结果生成时间要比此前的语音转文本模型缩短 70%。

目前该模型已经面向开发者通过 Gemini API 平台进行公共预览,Gemini for macOS 版用户也可以使用该模型,在 Gemini for macOS 版中用户可以直接通过语音要求 AI 分析本地文件、改写文本和生成图片等。

谷歌也确认未来该功能将支持 Chrome 浏览器,到时候用户可以直接在网页输入框中使用自然语音完成文本内容的输入和编辑。

热门推荐仅需99元/年,硅谷CN2GIA服务器,另有3年版仅需528元,限量销售,售完即止

  • 英伟达计划以129亿美元收购🤗抱抱脸 不过目前还未公布官方消息

  • 美好时光即将过去:Codex将从明天开始恢复5小时限额(仅Plus订阅用户)

  • 微软正在为Windows 11开发新的内存管理功能 用户可以手动分配不同任务内存量

  • 对象存储服务提供商又拍云及其法人被签发限高令 疑似公司遇到经营问题

  • 微软称安装8月更新后Windows 11游戏异常原因已找到:与RGB灯效驱动程序有关

  • 索尼向PS玩家发邮件强调 玩家购买的数字游戏仅为授权许可 而不是卖给玩家的


文章来源: https://www.landian.news/archives/126490.html
如有侵权请联系:admin#unsafe.sh