这条 Claude Mythos 新闻的核心,是 Anthropic 下一代模型可能出现了一次明显跨级提升。外部流传材料称,Claude Mythos 在写代码、解决复杂学术问题和网络安全任务上,都比上一代高端模型 Claude Opus 4.6 “大幅更强”。这不是普通版本更新,因为 Opus 4.6 本身已经很强:在真实软件项目修 bug 的测试里,它已经能解决约 80.8% 的问题;在研究生级科学问答里得分约 91.31%;在抽象推理测试里约 68.8%;在数学竞赛题测试里接近满分,达到 99.79%。
更直接地说,如果这些泄露说法属实,Claude Mythos 的意义是:AI 可能不只是回答问题更流畅,而是更接近能独立处理真实工作。比如在软件开发场景里,现有 Claude Opus 4.6 已经能修复大量真实开源项目里的 bug;第三方整理页推算,Mythos 可能把这类真实修 bug 成功率从 80% 出头推到 85% 到 88% 左右。另一类测试看的是模型能不能在电脑终端里连续完成多步骤开发任务,外界推算 Mythos 可能接近甚至超过 90%。这意味着它可能更擅长看懂大型代码库、改多处文件、跑测试并修正错误,而不只是给程序员写一段示例代码。
推理能力也是这次泄露的重点。Opus 4.6 已经能在研究生级科学问题上拿到 91% 左右,在数学竞赛题上接近满分;泄露材料仍然说 Mythos 在这些能力上“大幅高于 Opus 4.6”。如果最终得到确认,这代表 Anthropic 的新模型不只是常识问答更好,而是在需要多步推理、跨领域理解和复杂判断的任务上继续抬高上限。
最敏感的部分是网络安全。泄露材料称,Claude Mythos 的网络安全能力“远远领先于任何正在使用的 AI 模型”。这句话的含义很重:它可能更擅长发现软件漏洞、分析系统弱点、理解攻击路径,也可能帮助安全团队更快排查风险。正因为这种能力既能用于防御,也可能被滥用,外界才认为 Mythos 不会像普通 Claude 新版本那样直接全面开放,而是会先限制给少量经过筛选的安全机构或早期客户测试。
所以,这条新闻真正值得关注的不是某个英文评测名,而是三个容易理解的变化:第一,写代码可能从“能帮忙”走向“能处理更完整的真实项目”;第二,解难题能力可能继续超过已经很强的 Opus 4.6;第三,找漏洞和做网络安全分析的能力强到让 Anthropic 必须更谨慎发布。目前具体分数还没有得到 Anthropic 正式新闻稿确认,但官方 CDN 上已经能访问到 Claude Mythos Preview System Card,Anthropic 官网路径也出现了相关风险报告文件,说明这不是普通传言。
来源:Anthropic CDN 可访问的 Claude Mythos Preview System Card、Anthropic 官网风险报告路径、Claude Mythos 第三方基准整理页。