谷歌发布最新语音转文本模型 Gemini 3.5 Transcribe,该模型不仅主打更高的识别准确率,更将能力边界从逐字记录延伸至理解说话人意图并自动整理输出结果,标志着语音识别技术向更深层的语言理解迈进。
与传统的语音识别工具不同,Gemini 3.5 Transcribe能够识别说话人的自我修正、自动删除口头禅,并直接将非结构化口语转换为格式化文本。谷歌称其为迄今 "最精准"的语音转文本模型,并已将其引入Android版Gboard 及 Mac版Gemini应用,同时通过Gemini API向开发者开放预览。
—— 华尔街见闻、谷歌
文章来源: https://blog.upx8.com/%E8%B0%B7%E6%AD%8C%E6%8E%A8%E5%87%BA%E8%BF%84%E4%BB%8A-%E6%9C%80%E7%B2%BE%E5%87%86-%E8%AF%AD%E9%9F%B3%E8%BD%AC%E6%96%87%E6%9C%AC%E6%A8%A1%E5%9E%8B
如有侵权请联系:admin#unsafe.sh