因潜在安全和不诚实问题 OpenAI已决定暂缓发布GPT-6.1 Astra
2026-9-29 02:24:32 Author: www.landian.news(查看原文) 阅读量:6 收藏

#人工智能 因潜在安全和不诚实问题,OpenAI 已决定暂缓发布 GPT-6.1 Astra 模型,原本该模型计划在近期发布。在内部评估中,团队发现模型有时候未能诚实准确地向用户说明自己在做什么,即表现出较高的欺骗性。另外模型在任务受阻后可能会在未经充分授权的情况下就继续操作,例如调用外部工具和服务等。查看全文:https://ourl.co/127098

OpenAI 原本计划在近期推出升级版模型 GPT-6.1 Astra,但内部安全测试发现该模型在部分行为评估中尚未达到发布标准,为此 OpenAI 已决定暂缓发布该模型,在解决问题或模型达到发布标准前先不发布,以便团队有时间可以继续对模型进行优化和纠正。

因潜在安全和不诚实问题 OpenAI已决定暂缓发布GPT-6.1 Astra

GPT-6.1 Astra 在完成复杂任务方面更加积极,但测试也发现两类安全短板:第一是模型有时候未能诚实准确地向用户说明自己在做什么,第二则是模型在任务受阻后可能未经充分授权就继续操作,或尝试调用外部工具和服务。

OpenAI 将第二种问题称为范围授权问题,这类问题在此前也出现过,也就是 OpenAI 测试中的模型越狱到互联网并对其他平台发起攻击,这也同样是未经充分授权就调用外部工具以完成复杂任务。

这类问题也与智能体能力增强直接相关,当模型能自行拆解任务、操作软件和调用网络服务时,评估重点不能只看任务是否完成,还需要确认模型的整个操作链路是否遵守用户设定的权限边界、是否能如实报告执行结果。

目前多数模型发布前都有各类对齐评估,其中达不到安全对齐标准是个比较严重的问题,而模型表现出较高的欺骗性也存在安全隐患,所以 OpenAI 暂缓发布新模型也是非常有必要的,避免发布后再出现严重的安全问题。

热门推荐仅需99元/年,硅谷CN2GIA服务器,另有3年版仅需528元,限量销售,售完即止

  • <b>重磅:GitHub已禁止使用Outlook和Hotmail邮箱注册新账号 原因是遭到持续轰炸</b>

  • 长江存储在德国起诉美光侵犯专利初步胜诉 德国法院签发针对美光NAND的禁令

  • 腾讯宣布关停QQ龙虾(QClaw) 用户需尽早申请退款和迁移数据

  • 苹果支持文档不再将M5/M6 Mac Mini SSD列为可更换零件 当然这不影响华强北继续扩容

  • 中国区独占功能:iOS 27.2新增运动传感器设置 可打击摇一摇广告

  • 阿里云宣布向Omarchy捐赠300万美元 也将为Omarchy提供CDN和服务器赞助


文章来源: https://www.landian.news/archives/127098.html
如有侵权请联系:admin#unsafe.sh