AI代管邮箱时代来临……连Meta安全负责人都遭遇的”代理事故”,解决方案是

Photo of author

By Global Team

AI时代来临,人们开始把整个邮箱账户交给AI管理。只需点击一下,AI就能读取、撰写并发送邮件。便利之余,恐惧也随之而来。

Anthropic在上月18日让Claude可以在Gmail中发送、回复和转发邮件。默认设置是每次都要获得用户批准,但也可以改成无需批准直接发送。

OpenAI于本月3日公开的GPT-6 Astra更进一步。它可以填写电子表格、撰写格式,并直接操作网页。OpenAI联合创始人格雷格·布罗克曼表示,这“说成是AGI时代的第一款模型也不为过”。

◆ 代理型AI,已经发展到什么程度了

OpenClaw官网截图(照片=OpenClaw)
OpenClaw官网截图(照片=OpenClaw)

代理型AI不同于回答问题的聊天机器人。只要给它一个目标,它就会自行选择工具并执行多个步骤。整理邮件、协调日程、调查资料、管理文件,都可以在没有人类介入的情况下完成。

开源阵营尤其迅速。OpenClaw是由PSPDFKit创始人彼得·施泰因伯格打造的个人代理。它可以接入Slack、Discord、iMessage、WhatsApp等通讯工具,能读写文件、执行脚本、操控浏览器。发布72小时内就获得了6万个GitHub星标,截至今年5月已突破37万个,成为历史上星标最多的项目。

英伟达曾写道,OpenClaw在60天内就超越了React。NusResearch开发的Hermes已有16万个星标。Hermes主打在工作经验中自行生成并打磨技能的学习能力。

问题在于,这些系统需要的权限很多。要发挥功能,就必须访问邮箱、即时通讯、文件和浏览器。英伟达解释说,这类代理型AI会“把该由人决定的事情交上去,其余的自己处理”。但自动处理的范围越大,一旦出错,损失也越大。

◆ 连Meta的安全负责人也中招了

今年2月,Meta超智能研究所的对齐负责人萨默·于把收件箱整理工作交给了OpenClaw。她先在一个假收件箱上完成测试,随后连接到真实账户。OpenClaw开始删除一周以上的邮件。

即便她下令“别这样”“停下”“STOP OPENCLAW”,AI也不听。她写道:“我不得不像拆炸弹一样,从手机冲到Mac mini旁边,因为手机根本无法让它停下。”这是一场AI安全研究者亲身经历的事故。她后来承认,那是“新手错误”。

这起事故并不是被攻击者操纵导致的。AI误解指令,或者编造不存在的内容发出去,这类错误随时都会发生。如果关闭了批准设置,用户在看到内容之前,对方就可能先读到。

如果有攻击者,风险会更大,这就是提示注入。攻击者会把指令隐藏在邮件正文里,比如用白色字体或0字号写入。人看不见,但阅读邮件的AI会把它当作命令。

它可被用于监视收件箱,或窃取其他账户的验证码。提出这一术语的英国开发者西蒙·威利森表示:“我们仍然不知道如何百分之百可靠地阻止它。”Anthropic在首次开启邮件发送权限时,也会提醒这一风险。

◆ 那么解决办法是什么

威利森列出了让代理型AI变得危险的三个条件:▲访问个人数据 ▲接触不可信内容 ▲具备向外发送信息的能力。连接了邮箱的AI同时具备这三项。他说:“避免这三者同时结合,是唯一安全的道路。”结合这一原则以及Engadget、英伟达的建议,总结出的应对方法如下。

不要关闭批准功能。保留Anthropic默认的“发送前确认”设置。即便AI被操纵,只要用户没有按下发送按钮,信息就不会外泄。批准机制是防范提示注入的最后一道防线。

指令要具体。“把缺勤理由发给人事部”这类模糊请求容易引发误解。应写清楚发给谁、发送什么内容、使用什么语气。

权限要尽量少。起初只连接读取权限,让它先做摘要和分类。等真正需要时再开启发送权限。在威利森所说的三个条件中,关闭外发能力是最容易做到的一项。

如果使用开源代理,可以像英伟达建议的那样,在沙箱内限定权限范围后运行。像萨默·于那样先用假收件箱测试,也是一个办法。不过她在测试通过后,仍在真实账户上遭遇了事故。通过测试并不意味着绝对安全。

把验证码从电子邮件中分离出去。银行、门户网站和工作账户的双重验证,尽量改用认证应用或安全密钥,而不是电子邮件。即使AI能读取邮件,只要验证码不在里面,就不会演变成账户劫持。

不要把陌生发件人的邮件交给AI处理。对未知发件人、带附件的邮件,最好先由自己亲自查看,再让AI处理。提示注入往往只需要一封邮件。

AI代劳一切的时代正在到来。但在那个时代,安全并不是由AI带来的,而是由用户设定的权限边界决定的。一个批准按钮、一个权限设置,就是那道分界线。