Anthropic推出Claude安全工具:可读取隐藏推理并识别欺骗行为

Anthropic推出一款面向Claude安全评测和对齐研究的工具,可读取Claude在生成回答背后的隐藏推理,并用于发现模型是否存在欺骗性行为。相比过去主要依赖输出内容、红队提示和人工审查的方式,这项工具把检测对象推进到模型内部推理过程,帮助研究人员在高风险任务、企业部署前测试和模型能力升级评估中更早发现异常。对开发者和安全团队而言,它提供了评估Claude是否按指令诚实执行、是否在回答中掩盖真实意图的新手段,也强化了Anthropic在模型可解释性和AI安全工具上的竞争位置。据SOFX报道。

来源:SOFX

原始发布时间:2026年7月8日 11:50