美国人工智能(AI)企业Anthropic推出了新AI模型“Claude Fable 5.1”和“Claude Mythos 5.1”。公司在提升性能的同时降低了使用费,并一并公开了在科学研究中取得的实验成果。Anthropic在1日(当地时间)的发布中表示,这些模型“在编码和知识工作方面处于世界最高水平,并具备展示AI将如何为科学进步作出贡献的研究能力”。
◆ 同一模型,不同安全装置
先要说明两款模型的关系。Fable 5.1和Mythos 5.1从内部看是完全相同的模型,区别只在于安全装置的强度。
Fable 5.1面向所有人开放,属于通用版;而Mythos 5.1仅向经过验证的机构和个人开放。它是为网络安全和生命科学等可能伴随风险的专业工作而调整安全设置的版本。可以理解为同一台引擎,分别装在普通道路用车和受控测试场用车上。
Anthropic表示,在提升性能的同时,也针对客户一直提出的价格、数据保留和安全装置等三个问题进行了改进。
◆ 使用费降25%,最多可降45%
最引人注目的变化是价格。以一般任务为基准,Fable 5.1的使用费比前一代模型Fable 5便宜约25%。在复杂编码或多步骤自动处理任务中,降幅最高可达45%。
关键在于“缓存读取”费用下调。这个术语听起来陌生,但原理很简单。AI会按“token”单位处理用户输入的文档或对话。长文档反复处理时,如果每次都从头读取,成本会非常高。
因此系统会把已处理内容保存下来再次调用,而重新读取这些已保存内容的过程就是缓存读取。Anthropic将缓存读取费用从每100万token 1美元降至0.25美元,直接下调75%。
重复性工作越多,节省效果就越明显。因为在频繁参考文档的自动化任务中,缓存读取往往占据大部分总成本。其余费用保持不变。输入每100万token为10美元,输出每100万token为50美元。若韩国的开发公司或初创企业使用Claude,同样的任务将能以更低成本运行。
◆ 性能提升到什么程度
Anthropic公布了多项测试(benchmark)结果。Benchmark是用规定问题来比较模型能力的性能测试。相关数值均为Anthropic自行测定。
在衡量科学研究能力的“TerminalBench-Science”中,Fable 5.1得分为52.6%。公司称,这一成绩超过了前一代Fable 5的24.7%,也高于原本定位更高的Opus 5(29.0%)以及竞争对手模型。
在通过命令行处理编码任务的“TerminalBench 4.0”中,Fable 5.1得到55.8%,去除安全装置限制的Mythos 5.1则为60.9%。在代码工具Cursor的测试“CursorBench”中得分73.4%;在考察多领域知识的“人类最后的考试”中,不使用工具时为60.9%,使用工具时为65.0%。
Anthropic强调的不是单纯的分数,而是工作方式的变化。公司称,Fable 5.1会避免走“看起来正确”的捷径,而是寻找问题的根本原因并加以修复。公司还举例称,在投资公司Millennium的测试中,Fable 5.1找出了其内部系统中极少发生的错误原因。该问题大约100万次才出现一次,过去4到5年里,没有任何工程师或其他AI模型能解释清楚。该模型最终通过拆解外部厂商的软件并对照错误记录,找出了软件内部存在的缺陷。
率先试用的企业也给出了评价。金融公司Jane Street表示:“它比以往模型解决了更多编码问题,在长任务中也更容易跟上说明。”开发工具公司Cognition则表示:“由于单次任务成本更低,我们正把原本交给Opus的代码审查工作转移给Fable 5.1。”
数据库企业MongoDB说:“我们三天就完成了一个复杂原型,而且它能连续数小时无人值守地独立推进工作。”金融科技公司Ramp称:“在连续38小时无人值守运转的任务中,它主动发现并纠正了既有研究结果中的错误。”
◆ 数据保存在客户服务器上……引入EFS
企业使用AI时最敏感的问题之一是数据保管。很多人担心公司机密会不会留在AI公司服务器上。Anthropic新推出了“企业前沿安全装置(EFS)”方案。
其核心在于,数据保存在由客户控制的云端,而不是Anthropic手中。需要人工审查内容时,也由客户自行处理,而不是由Anthropic介入。公司称,这一方式在保持“零数据保留”级别的保密性的同时,也保留了防止滥用的监控功能。
该方案与金融、医疗、制造、法律等领域100多家企业,以及亚马逊、谷歌、微软云共同开发。它将从今年秋季开始分阶段应用,在准备完成之前,符合资格的客户可以在不保留数据的条件下使用Fable 5.1。
◆ 安全装置减少对无害请求的误拦截
AI安全装置的难题之一是“误判过度拦截”,即把无害问题误认为危险请求而阻止回答。例如,医学问题或安全人员为保护自身系统而进行的正当工作,如果也被挡下,工具的实用性就会下降。
Anthropic表示,Fable 5.1大幅减少了误判。网络安全领域中,新的安全装置比之前减少了60%的误拦截。以Claude Code用户为基准,每个会话中安全装置介入次数平均减少约60%。
这与Fable 5.1可用于发现软件弱点的防御工作有关。不过,用来制造攻击工具的行为仍会被阻止。渗透测试或攻击代码制作等具有双重用途的任务,仍会转交给更高级的Opus模型。
生命科学领域也做了调整。对于小学程度的生物学或医学问题,安全装置触发频率降低了85%。但与实际研发相关的问题,仍会交由更高级模型处理。与此同时,公司还与美国政府合作,为经过验证的生命科学专家开放Mythos 5.1的高级生物学功能,并准备了访问项目。
◆ AI助力科学……三项实验
此次发布中,Anthropic特别强调了科学研究成果,并公开了三项案例。
第一项涉及与新药开发密切相关的分子设计。很多药物通过与体内靶点结合而发挥作用,因此设计能够强力结合靶点的物质(binder)是新药开发的第一步。
Mythos 5.1借助公开的蛋白质设计工具设计了结合体,并由两个外部机构通过实验验证。结果相当引人注目:在三个靶点上,结合力达到相关竞赛最高纪录的10倍;在12个靶点上,成功率接近50%。通常该领域的成功率约为10%至15%。
第二项是金星地形图。Fable 5.1训练神经网络,为金星约三分之一的区域制作了新的高分辨率地形图,基础数据来自30多年前美国航空航天局(NASA)“麦哲伦”探测器拍摄的雷达图像。
新地图将此前10至20公里级的分辨率提升到2至3公里,地形高度信息的准确度最高提高了25%。Anthropic表示,希望这份地图能帮助未来NASA和欧洲航天局(ESA)的金星探测任务,因此以公开许可方式发布。
第三项是计算生物学。生物学研究中,AI模型常常要在GPU上运行数千次,速度直接影响研究进度。Mythos 5.1直接改进了在GPU上运行的程序,使7个公开的深度学习模型速度最高提升2.5倍。
在结果不变的前提下,只提升了速度。用于整个基因组分析的工作中,GPU成本减少了30%到60%。Anthropic称,原本需要多名性能工程师花费数周才能完成的工作,如今只需几天就能完成。
◆ 安全性验证与EU监管应对
Anthropic表示,在发布前已进行风险测试,确认其是否可能被滥用于化学和生物武器制造,以及网络攻击能力处于何种水平。公司通过内部评估和外部验证得出结论:虽然Mythos 5.1的生物学能力较之前有所提高,但仍未达到公司设定风险标准的下一阶段,因此将以与此前相同的安全装置进行部署。
公司还应对了欧盟(EU)AI监管。Anthropic今年7月与另外190多个机构共同签署了《EU AI法案》的内容标示规范。8月2日以后发布的模型输出将带有不可见标记(watermark),用于判断Claude是否参与了文本创作。这一标记不包含用户或对话内容信息,若无专用识别工具无法直接确认。
◆ 今日起可用
Fable 5.1自发布日起即可在AWS、谷歌云、微软Azure等所有主要平台上使用。开发者可在Claude API中通过“claude-fable-5-1”调用。
Mythos 5.1仅向经过验证的网络防御人员和生命科学专家开放,目前仅限美国部分机构。Anthropic表示,将与美国政府协商,把适用对象逐步扩大到国内外更多地区。
这次发布在降价、提性能的同时还强调科学研究成果,也显示出AI模型竞争正从单纯的性能比拼,转向成本、安全与实际用途。尤其在新药设计和基因组分析等科学领域取得的成果,也成为判断AI是否会加速成为实验室工具的重要风向标。