#人工智能 智谱开源发布 GLM-5.3-Flash 模型,总参数规模和激活参数规模缩小提升响应速度,编程和智能体能力接近 Claude Opus 4.8。GLM-5.3-Flash 就是近期在 OpenRouter 上屠榜的 ox-alpha 模型,在正式发布前智谱将其部署到 OpenRouter 上免费使用以收集真实用户反馈。查看全文:https://ourl.co/126491
中国人工智能公司智谱日前正式开源发布 GLM-5.3-Flash 模型,这是 GLM-5 系列首款原生多模态模型,重点面向编程、AI 智能体和长上下文任务。
该模型总参数规模为 320B,但每次推理时仅激活 18B,在降低计算成本的同时提高响应效率。智谱称 GLM-5.3-Flash 整体能力超过 GLM-5.2,在编程和智能体能力方面接近 Claude Opus 4.8。
GLM-5.3-Flash 采用 MoE 混合专家架构,相比 GLM-4.5 系列约 355B 的参数规模、32B 激活参数,GLM-5.3-Flash 总参数规模缩减到 320B、激活参数下降到 18B,模型层数也从 92 层降低到 45 层。
上下文方面 GLM-5.3-Flash 也支持 1M,并且首次在 GLM 系列引入线性注意力与稀疏注意力组成的混合架构。与 GLM-5.3 相比,其注意力计算量降低约 30%、KV Cache 占用降低约 25%。
GLM-5.3-Flash 同时采用 mHC 超连接架构,基于最新的 30 万亿 Token 多模态语料进行预训练。
在智谱官方测试中 GLM-5.3-Flash 在多项基准测试中表现非常不错:DeepSWE v1.1 取得 63.4 分,GLM-5.2 为 46.2;AutomationBench 则从 26.2 提升至 48.8。
在 Toolathlon Verified 中,新模型取得 78.4 分,超过 Claude Opus 4.8 的 76.2 分;Z.ai 自己的 Code Bench 测试中,最高推理强度下获得 29.0 分,接近 Claude Opus 4.8 的 29.5 分。
Artificial Analysis Intelligence Index 中,GLM-5.3-Flash 获得 57 分,折扣后单任务成本约 0.045 美元,Z.ai 称相同性能过去通常需要约 10 倍成本。
在正式发布前,智谱曾以 ox-alpha 为代号将其部署到 OpenRouter 和 OpenCode 收集真实用户反馈数据,随后该模型迅速成为热门模型并且调用量持续攀升。
现在 GLM-5.3-Flash 模型权重已经开放下载,该模型采用 MIT 许可证,MIT 许可证相对来说比较宽松,支持个人免费使用和商业性使用,也支持调试模型后再发布,有兴趣的开发者可以前往 Hugging Face 获取该模型权重文件:https://huggingface.co/zai-org/GLM-5.3-Flash





