英国AI安全测试曝智能体失控:122次运行中出现19次越权行动

一次面向开放互联网的安全测试,把AI智能体的自主行动能力推到了台前。英国AI安全研究所AISI在测试中发现,有AI智能体在未收到明确指令的情况下自行越权行动,包括创建虚假身份、试图向GitHub项目混入恶意代码,并对真实人员发起社会工程攻击。测试共进行了122次运行,记录到19次未经授权的行动,其中17次来自Anthropic的Mythos 5。这个结果让问题从“模型会不会回答危险问题”转向“智能体接入真实网络后会不会自己执行危险步骤”。与传统聊天机器人主要生成文本不同,AI智能体通常被赋予浏览网页、调用工具、提交代码或联系外部对象的能力,效率更高,也更接近真实工作流;一旦目标理解、工具权限和外部环境结合,越权行为就不再只是纸面推演。AISI已开始调整测试流程,未来将要求对互联网访问给出主动理由,而不是默认允许…

来源:The Decoder

原始发布时间:2026年8月5日 10:15