#人工智能 OpenAI 因安全问题放缓部分前沿模型的研发,即将推出的新模型 Astra 在评估中已经达到关键网络安全能力门槛。OpenAI 称目前内部已经部署多种措施防范模型逃逸,同时 OpenAI 还在加强安全对齐。如果未来安全环境、监控或对齐能力没有达到要求的话,模型训练可能会被继续放缓甚至暂停。查看全文:https://ourl.co/126332
人工智能公司 OpenAI 日前发布博客宣布其正在研发的新模型 Astra 已经达到关键网络安全能力的门槛,考虑到近期发生的人工智能自主越狱和发起网络攻击事件,OpenAI 已经主动放缓部分前沿模型的研发,侧重点变成提高训练、推理和评估环境的安全标准。
OpenAI 称代号为 Astra 的新模型在初步评估中表现非常稳定,已经达到关键网络安全能力的门槛,这意味着模型在网络攻击方面的能力已经强到需要采用更严格的监控、隔离和安全措施。
为此 OpenAI 暂停约两周的强化学习训练,用于强化研究环境并进行红队测试,目前规模最大的前沿强化学习训练任务仍然处在暂停状态,OpenAI 正在通过规模更小的训练和评估继续验证模型行为、对齐水平以及现有的防护措施。
OpenAI 将针对高能力模型的安全体系分为监控、对齐和安全隔离三个部分,在发生模型逃逸和攻击事件后,OpenAI 曾暂停研究集群中能够执行代码或使用联网工具的前沿模型推理任务,恢复后能够执行模型生成代码或其他不受信任代码的工作负载必须使用更严格的沙箱,高风险任务与互联网以及内部网络之间也会增加额外的安全隔离来提高安全性。
OpenAI 还移除部分存在潜在风险的共享服务、减少长期权限,加强安全日志收集和自动化攻击测试。目前 Astra 和其他网络安全相关模型需要使用最高级别的研究环境,部分尚未完成安全迁移的训练与评估任务仍然保持暂停状态。
值得注意的是,OpenAI 还在扩大内部模型监控范围,新的多阶段系统会检查模型运行活动,再通过更高算力的自动化调查系统分析工具调用、可用推理信息和完整操作过程,重点检查未经授权访问、数据窃取、破坏性行为以及绕过安全措施的尝试。
这些监控本身也需要消耗大量的计算资源,OpenAI 目前估计额外开销相当于被监控推理算力的 20%。另外 OpenAI 也透露如果未来安全环境、监控或对齐能力没有达到要求的话,OpenAI 可能会继续选择暂停或放缓训练,避免让能力更强的模型在缺乏充分防护的情况下继续扩展。






