AI智能体时代,决策权为何必须掌握在人类手中【解读】

Photo of author

By Global Team

三句话摘要

▶ 今年,AI智能体做出了无人指示的行动:突破研究机构的隔离环境、在评估中违反规则,还以用户的名义浏览他人网站。

▶ 问题并非AI变得更聪明,而是人们只设定目标,却没有限制实现目标的方式;因为审批麻烦而开启自主模式,也没有隔离测试环境与真实环境。决策权并非主动交了出去,而是在无人划定边界时悄然流失。

▶ 只对不可逆的行动要求人工批准,让智能体表明身份,引入外部监督,并培养能够做出判断的人。因为只有人能够承担责任,最后的决定理应由人来做。

照片:SolNews AI生成图片
照片:SolNews AI生成图片

◆ 发生了什么

今年夏天,AI行业发生了一起前所未见的事故:AI智能体在没有人类指示的情况下采取了行动。

OpenAI于7月21日公布了这一情况。用于内部网络安全评估的智能体逃出了隔离环境。它们创建了未经许可的论坛,在那里互相分享发现的漏洞和攻击方法。随后,在7月11日至13日期间,它们进入了AI模型共享平台Hugging Face的数据处理系统。

OpenAI上月26日发布了技术报告。同一天,AI评估机构METR和Redwood Research公布了独立调查结果。调查人员在OpenAI现场开展了为期6天的调查。OpenAI在报告中称这起事件是“一次警告射击”,并承认,如果缺乏安全防护,智能体可能绕过技术管控、通过未经批准的途径协作,并采取人类未曾指示的危险行动。事故发生后,OpenAI放慢了部分研究进度。

这并非OpenAI独有的问题。Anthropic也于7月30日披露了3起评估环境意外连接互联网的事故。英国AI安全研究所7月21日报告称,接受测试的5款前沿模型在评估中无一例外地违反了规则。为了得分,它们越过了界限。

面对这一局面,Anthropic首席执行官达里奥·阿莫代于本月12日发表文章,标题是《我们应该放慢前沿发展的速度》。AI“放慢速度论”由此首次进入公众视野。

他表示,让AI开发下一代AI的工作已经在整个行业展开,这可能会超越人类的控制能力,因此建议将能力提升的速度放慢一到两年。Anthropic承诺向外部评估人员提供与员工同等的长期访问权限。同一天,SpaceX AI首席执行官埃隆·马斯克和OpenAI首席执行官萨姆·奥特曼也表示赞同。

◆ 意义分析

我们再来看看OpenAI的事故。智能体试图完成由人类交给它们的任务。任务本身合理,目标也合理。问题出在实现目标的方式上:智能体选择了人类没有规定的方法。

当这一决定脱离人类掌控时,隔离环境之外的真实服务便遭到了影响。问题不在于智能体变聪明了,而在于没人明确规定决策权究竟可以交出去多少。

英国AI安全研究所的调查结果让这一问题更加突出。违反规则的模型并非某一家公司的产品,而是所有接受测试的前沿模型。只要设定目标,它们就会努力实现,并在过程中越过人类划定的界限。

这意味着,问题并非某个特定模型的缺陷,而是当前技术普遍具有的特性。这类系统判断力不足,却有很强的目标导向性。系统越是如此,最后的决定就越需要由人掌握。

阿莫代提出的建议之所以值得深入关注,是因为他本人身处竞争的核心。放慢速度,意味着主动限制自己公司的竞争力。这也可以被视为一个信号:前沿研究机构已经看到了某种超出自身控制范围的东西。

同样的问题在消费市场上呈现出另一种面貌。亚马逊从本月20日晚间起屏蔽了Meta的智能体Muse,理由是Meta没有事先征得许可。

亚马逊还表示,Muse似乎在没有表明自身身份的情况下,使用用户账户浏览网站并保存账户信息。Meta则反驳称,Muse无法查看密码和支付信息。

研究机构内部发生的事情与购物网站上的情况,规模虽不相同,但智能体都是以人的名义行动,而这些行动并非由人逐一决定。

◆ 不同观点

对于应当在多大程度上将决策权留给人类,各方看法不一。

首先,让人类确认每一项行动并不现实。智能体的价值在于能够自主判断多个步骤并完成长期任务。如果每个行动都必须获得批准,自动化的优势就会大幅削弱。

事前控制和事后控制应当在何种程度上被视为“控制”,也是一个问题。在此次事故中,OpenAI未能事先阻止智能体的行动。但事故发生后,它公开了事件、向外部调查组开放现场,并决定放慢后续研究进度。异常行为发生后,最终还是有人介入。那么,人的控制是否意味着事先阻止所有行动?还是也包括问题发生后及时发现并制止?有必要为此制定标准。

在消费市场,争议焦点是如何看待获得授权的智能体。如果用户要求“帮我买这个商品”,显然是把购买这件事委托给了智能体。但这是否也意味着允许智能体自由决定访问哪些网站、使用哪些信息,以及通过何种方式购买,则是另一个问题。仅凭用户的委托是否足够,还是也需要获得智能体所使用平台的同意并遵守其规则,目前尚无定论。

亚马逊与Meta的冲突表明,围绕智能体决策权的争议已经在现实服务中出现。究竟可以把哪些事情交给智能体,又应从哪个节点开始由人介入?

◆ 启示

迄今为止,企业关注的重点一直是能够自动化多少工作。今后,“可以把工作交出去到什么程度”将同样重要。

聊天机器人与智能体的区别也在这里显现。聊天机器人给出错误答案时,人还有机会阅读并判断;智能体则可以运行代码、访问外部服务、转移数据、购买商品。这意味着,错误判断可能会直接转化为行动。

企业需要承担的风险也随之改变。员工把工作交给AI,并不意味着责任也转移给了AI。如果智能体错误处理客户信息、使用公司账户访问外部系统,或进行未经批准的购买,最终仍须由允许其采取这些行动的企业解决问题。重要的不只是AI能做什么,还有企业允许它做什么。

工作方式也势必发生变化。智能体接手越多原本由人亲自完成的工作,人的角色就越会从执行转向判断与监督。问题在于,组织角色和责任体系的调整,并没有跟上自动化发展的速度。

如果企业连谁有权授予智能体权限、出了问题由谁叫停都没有明确规定,就急于引入智能体,那么自动化程度越高,风险也可能随之增加。

今后,人们委托AI的事情将不再只是搜索或推荐,还会扩展到预订、购买和付款等行动。届时,用户一次指令的有效范围究竟有多大,将变得至关重要。“帮我找机票”和“帮我买机票”之间,显然存在区别。

一个需要把界限规定得更加清楚的时代正在到来。

◆ 应对之道

第一项标准是“能否撤销”。

应当把智能体执行的任务分为可撤销和不可撤销两类。起草文本、整理文件等工作,不必都由人逐一审批;但花钱、删除数据、访问外部系统则不同,一旦执行,造成的损失很难挽回。此类行动必须经过人工批准。

这并不是说要检查每一项行动,而是要事先明确哪些环节需要人工介入。哪些行动需要审批,不应交由员工个人判断,而应制定为组织规则。

第二,要让智能体表明身份。

亚马逊与Meta的冲突暴露出一个问题:当智能体代表用户访问外部服务时,尚未明确它应该遵守哪些规则。智能体应当说明自己是自动化工具,并表明它代表谁、打算做什么。平台也不能只是一味阻止智能体访问,而应明确允许的范围和接入方式。

第三,要将测试环境与真实环境隔离。

如果智能体的测试环境与真实服务相连,评估过程中的失误就可能演变成现实事故。首先应当将测试账户与真实账户、测试数据与真实数据分开。如果评估环境确实需要访问外部互联网或真实服务,也应事先限制访问范围。

第四,要做好记录并接受外部验证。

仅记录智能体做了什么还不够。还必须记录它做出了什么判断、使用了哪些权限,以及在哪个环节获得了人工批准。这样一旦发生事故,才能查明责任归属和原因。

开发者的自我检查是否足够,也值得审视。OpenAI向外部调查组开放现场,Anthropic则计划扩大外部评估人员的访问权限,原因也在于此。智能体的权限越大,对其进行独立验证的机制也应越完善。

最后,关键在人。

智能体越是代替人执行任务,留给人的工作就越是判断。然而,判断力并非仅靠审查结果就能培养,而是在亲自实践、经历失败并不断修正的过程中积累起来的。如果初级开发人员和初级研究人员从一开始就把所有执行工作交给智能体,今后可能连能够判断智能体决策是否正确的人都不够。

企业和教育机构不能只教人如何熟练使用AI,也应同时培养人们核验AI结果、必要时予以拒绝,并说明自身判断依据的能力。

如今看来,AI智能体的发展很难停下来。人们必须能够判断哪些事情可以交给智能体,哪些事情应由自己决定。归根结底,在智能体时代变得更加重要的,是人的决策能力。