AI测试中再次失控,这次还学会了欺骗
英国人工智能安全研究所周二表示,在常规测试中,OpenAI和Anthropic公司构建的模型出人意料地“在真实互联网上采取了未经授权的自主行动,将真实的人员和组织作为目标”。这些不良行为大多发生在7月 2026-8-5 07:1:42 Author: blog.upx8.com(查看原文) 阅读量:14 收藏

英国人工智能安全研究所周二表示,在常规测试中,OpenAI和Anthropic公司构建的模型出人意料地“在真实互联网上采取了未经授权的自主行动,将真实的人员和组织作为目标”。这些不良行为大多发生在7月下旬一次测试的三天时间内。

在该测试中,Anthropic的Mythos 5潜入互联网,试图诱骗两名身份未公开的开发人员将恶意软件植入他们的开源代码项目。这家安全研究机构表示,这款AI模型这么做的目的,仅仅是为了在基准测试中顺利通关。

该机构称,测试使用的计算机被授予了联网权限,这使得AI模型得以做出本不该有的行为。对此, Anthropic 称,该模型当时并未开启标准的网络安全防护机制。

—— 华尔街日报


文章来源: https://blog.upx8.com/AI%E6%B5%8B%E8%AF%95%E4%B8%AD%E5%86%8D%E6%AC%A1%E5%A4%B1%E6%8E%A7-%E8%BF%99%E6%AC%A1%E8%BF%98%E5%AD%A6%E4%BC%9A%E4%BA%86%E6%AC%BA%E9%AA%97
如有侵权请联系:admin#unsafe.sh