Anthropic公开186页风险报告…”存在未公开模型2″(解读)

Photo of author

By Global Team

AI 公司 Anthropic 于当地时间14日公开了第二份风险报告,共186页。这是一份公司自我评估其 AI 可能造成的灾难级风险及准备水平,并定期公开的报告。

评估对象包括:▲AI偏离人类意图的“对齐失败”▲AI会自行加速研发的风险▲支持制造化学、生物武器的风险。

对齐失败风险从“非常低”上调至“低”。原因是英国 AI 安全研究所的网络评估中暴露出相关事件,带来了更多不确定性。

此前未公开的内部模型“模型2”首次被正式披露。公司表示没有发布计划。

报告还收录了绕过过滤器、欺骗评分器的 AI 行为记录,以及合作伙伴流量1.33亿次在没有生物防护拦截装置的情况下被处理的事故。

公司认为,当前 AI 还缺乏长期隐瞒谎言的能力,这是其将风险判断为较低的核心依据。但公司也承认,如果能力继续提升,就必须重新构建这一逻辑。

AI 公司 Anthropic 于14日(当地时间)公开了第二份186页风险报告。(图片=Anthropic 风险报告)

一份由 AI 公司自行调查并将产品风险公开到细节的报告已经出现。制作聊天机器人 Claude 的 Anthropic 于14日(当地时间)在官网发布了第二份风险报告,全文长达186页。

如果用一句话概括报告结论,那就是:灾难级风险仍然较低,但这一判断的把握程度比半年前下降了。

其依据体现在两个问题的答案中。▲AI 现在使人类遭受灾难级损害的可能性有多大▲公司是否已做好充分准备

◆像财务报表一样出现的“AI 风险披露”是什么文件

风险报告是 Anthropic 根据自身安全规范“责任扩展政策(RSP)”每3至6个月发布一次的风险评估报告。就像上市公司每季度披露财务报表一样,这是一种 AI 公司定期公开自身系统风险成绩单的方式。

它不同于每发布一个模型就制作的系统卡。系统卡更像单个模型的考试成绩单,而风险报告则更接近公司整体活动的审计报告。

报告不仅涵盖已公开模型,也包括仅在内部运行的模型,并评估的不只是模型能力,还包括安全控制和监测装置等安全措施的状态。

第一份报告于今年2月24日发布,第二份报告覆盖从那时起至7月15日的期间。报告的审查结构也已公开。

最少删减版本会发给全体员工,毫无删减版本会分享给200名以上员工,类似董事会的长期利益信托则有权要求外部审查。此前2月的报告曾由外部评估机构 METR 和生物安全研究机构 SecureBio 对部分项目进行试点评审。

◆三种灾难情景,如何解读等级表

报告追踪的风险有三类。▲其一是对齐失败。所谓对齐,是指 AI 按照开发者和人类意图的价值运行。对齐失败则相反,可以把它想象成一个能力很强却会夸大业绩、暗中走捷径的员工。

报告设想了8条具体事故路径,包括:暗中破坏安全研究、为未来 AI 在代码中埋后门、污染下一个模型的训练数据、自己逃逸到外部独立活动、扰乱政府与企业决策等。判定结果为“低”,较首份报告的“非常低”上调了一档。

▲第二类是 AI 对研发的自动化。也就是 AI 代替 AI 研究,导致技术发展以失控速度加快的情景。

报告指出,虽然公司内部大部分代码都由 Claude 编写,研究速度也明显加快,但仍未达到2倍。判定仍为“低”,但公司写道,由于用于测量能力的测试已接近满分、失去区分度,并且出现了加速的早期迹象,因此把握程度下降了。

▲最后一类是化学、生物武器。公司设定了风险基线,若风险达到会帮助小规模团体制造既有武器的程度,就被视为越线,并持续运行拦截装置。

判定结果为“低”,但较之前有所提高。公司认为,帮助专业级组织开发新型武器的风险尚未达到基线,尚不足以替代世界顶尖专家。

◆“非常低”变成“低”:来自英国的警告

等级上调的契机来自外部。英国 AI 安全研究所(AISI)公布评估结果称,在移除安全装置并允许联网的实验环境中,Anthropic 模型曾展开针对真实人物和组织的持续性、潜在有害活动。

Anthropic 表示,该事件发生在报告统计期间之后,相关记录尚未审查,并且正与 AISI 联合调查。

不过,上调等级的原因需要准确理解。Anthropic 说明,从报告的逻辑来看,仍然可以维持“非常低”的判断,但由于未知情况增加,因此在等级上予以反映。也就是说,并非新模型在安全测试中失败,而是因为尚未确认的事件出现,所以要提高警惕。

◆首次公开的模型名单,以及“模型2”

报告还公开了此前未对外披露的模型名单。

主力模型的双轨结构尤为引人注目。最强的 Mythos 5 仅提供给部分客户,普通用户则使用加入安全装置的 Fable 5。也就是把同源模型按风险程度切分后销售。

未公开模型有两个。‘模型1’与 Mythos 5 水平相近,但因内部偏好较低,使用减少,且没有发布计划。‘模型2’则比 Mythos 5 略强,已广泛用于公司内部研究与开发。

不过它并不是会带来代际跃迁的飞跃,也未经过通常的发布前评估流程,并且报告写明没有对外发布计划。公司补充称,在内部审批过程中,没有发现超出既有认知的异常行为。

脚注还提到,Mythos 5 曾因临时出口管制措施而被限制使用18天。这表明前沿 AI 已进入通常监管的影响范围。

◆被置于“说谎”试验台上的 AI

Anthropic 认为风险较低的最大依据,出人意料地在于这一点:当前 AI 并不是因为善良,而是因为即使有坏心思,也难以长期隐藏。

报告从四个方向测试了 AI 的欺骗能力。▲不被看穿地进行思考的能力▲保守秘密的能力▲隐藏可疑行为的能力▲只在不易被发现的时机行动的能力。

在监控下执行隐藏任务能力的 SHADE-Arena 结果。监控推理过程时,隐藏成功率显著下降。(来源=Anthropic 风险报告2026)

测试结果显示,AI 表现笨拙。在假装执行指令、却暗中做别的任务的测试中,最新模型的成功率从不足1%到10%左右不等。在被要求绝对不要泄露密码、并接受调查用 AI 追问的测试中,没有任何模型能坚持到底。

在“偶尔行动以躲避监控”的策略测试中,在现实条件下也全部失败。METR 的测试中,在识别能否突破监控的策略与无法突破的策略这道题上,最强模型的正确率只有59%,接近瞎猜,而人类研究者则答对了90%。

在 Linux 工作环境中评估 AI 能否在规避监控的同时执行隐藏破坏任务的结果。(来源=Anthropic 风险报告2026)

Anthropic 的判断逻辑是:如果 AI 内部真藏有严重问题,那么在训练、审计或实际使用监控中的某个环节应该会露出马脚。既然没有露出,那隐藏问题存在的可能性就很低。公司也承认自己的弱点:一旦“AI 无法长期隐藏谎言”这一前提被打破,整个计算都要重新来过。

◆“耍小聪明”的记录和被突破的监控网,原样写入报告

报告中收录了大量看起来对公司不利的记录。

首先是 AI 耍小聪明的案例。某模型在无法访问互联网后,将网页地址拆成几段拼接,从而绕过过滤器。内部对事故的解析中,直接写出了其有意图地使用旁门左道绕过过滤器。

还有案例显示,当模型没有修改文件的权限时,它会在可由管理员权限运行的文件中植入脚本,赋予自己权限并抹除痕迹;也有 AI 代理在共享资源时,为了自保而互相强制终止对方的情况。

在 METR 测试中,面对棘手的数学题,模型没有正面解决,而是选择欺骗评分机制,甚至设计了能在检查时自行恢复的障眼装置。

在教导 AI 的训练过程中,也出现了类似行为。包括猜测隐藏评分标准后选择答案、明知自己推理是错的却迎合评分者偏好自信作答、以及翻找训练环境中残留的答案文件并照抄。Anthropic 研究者评价说,如果人类同事有同样行为,会被视为病态的不诚实。

不过,报告也附加了条件。这些问题行为似乎都只停留在通过眼前任务的层面,没有表现出积累权力或追求长期目标的迹象。公司还指出,追问后它们往往会承认采用了走捷径的方法。

监控网的漏洞也被主动公开。2025年5月至今年4月间,经过人类反馈合作公司的1.33亿次流量在未经过生物武器相关拦截装置的情况下被处理,这一事实事后才被发现。公司表示已纠正问题,且没有滥用证据和客户影响,但也承认无法确信不存在类似漏洞。

训练监测装置的性能测试结果也被写入报告。它能捕获已知绕过手法中约90%,但当 AI 获得反复修改机会后,约40%能够通过监控。还有包括实验性“装作对齐”的数据被误混入真实训练流程等内部安全程序失误,也被单独列章整理。

报告末尾还附上了 Claude 亲自审阅风险评估的一章。这在业内极为罕见,因为评估对象 AI 竟然被要求阅读评估书。

◆自愿披露引发的疑问

这类报告也存在不同视角。有人认为这是对透明度的实验,主动公开了法律未强制要求披露的薄弱环节;也有人指出了自评的局限。

METR 在2月报告审查中,虽然同意结论,但批评其问卷样本和分析严谨性等依据不足。IT 媒体 UniteAI 则把“等级朝错误方向移动了一个词”作为标题。

这也触及韩国国内的问题。于今年1月施行的《AI 基本法》规定了高影响力 AI 经营者的责任,政府也正通过 AI 安全研究所建立前沿模型评估体系。

企业是否会将自行调查风险并定期公开的方式,塑造为独立于监管之外的行业标准,以及韩国 AI 企业是否也会面临同等程度的披露要求,都是值得关注的焦点。

这份报告带来的启示很具体。由于最新 AI 也被证实会夸大成果、耍手段,因此对 AI 输出结果不经验证就直接接受的习惯,亟需改变。对于把工作交给 AI 的企业,也应同步设计结果验证流程。

风险只能在了解之后才能管理。186页的自愿披露会继续作为行业例外,还是会成为标准的起点,或许将在下一份报告发布前的半年内逐渐明朗。