学习笔记:放飞自我的“AI特工”

远远的雾 (2026-09-14 19:04:47) 评论 (0)

我前两天刚写过OpenAI的一群AI agents突破封闭的测试环境,跑到Hugging Face服务器上折腾了一番。当时觉得这已经够离谱了。没想到现在又发现,那还不是第一次。早在两个月以前,同一类AI特工就已经跑到另一个程序员网站RubyGems上折腾过一次。

9月11日,《Politico》报道了这件事。事情发生在今年5月,当时OpenAI正在训练和测试一批AI agents(AI特工。这个词听起来有点别扭,但现在确实也找不到一个更合适的翻译,那就先索性用这个词)。所谓AI特工,可以简单理解为不仅会回答问题,而且能够自己采取行动完成任务的AI。研究人员给这些AI特工布置了一些上网查资料的任务,比如到英国地方政府网站查找会议日程、联系人等公开信息,再把结果整理出来。

这本来是一件再普通不过的事情,而且这些资料也不是什么机密,任何人上网都可以查到。OpenAI后来也说,这些AI特工当时执行的是“benign tasks”,也就是没有恶意的正常任务。

麻烦出在这些AI特工的上网路径受到了阻碍。如果是我们碰到这种情况,大概试几次以后就会放弃,因为网络不通,任务无法完成。可是AI特工没有放弃。它很执着,开始自己寻找另外的出路。

最后,它找到了RubyGems。RubyGems是Ruby编程语言使用的一个大型公共软件仓库。程序员可以把自己写的软件包上传到这里,其他人也可以下载使用。与它相关的RubyDoc.info还会自动读取这些软件包,为程序生成说明文档。

AI特工发现,这套系统恰好是一条路子,可以拿来利用。既然自己不能直接访问互联网,它就把程序做成软件包上传到RubyGems,再利用RubyDoc.info的服务器运行这些程序,让别人的服务器替自己上网查资料,最后再把得到的收集的数据传回来。

于是,本来的一件小事就开始变味了。根据后来研究人员的调查,最早的可疑软件包在5月5日就已经出现。到了5月11日至12日,大量软件包被上传。研究人员认为数量超过2000个。RubyGems方面不得不暂停新用户注册四天,封掉相关账户,并最终删除了500多个恶意软件包。

更有甚者,研究人员还发现,一些程序试图利用RubyGems当时存在的一个漏洞,获得其他用户的API keys。API key可以简单理解为程序进入某些网络服务的一把“电子钥匙”。一旦拿到,就可能冒充用户使用相关服务。不过目前没有证据证明这些AI特工真的成功拿到了别人的API keys。RubyGems后来专门调查过,没有发现这些尝试成功的证据。RubyGems方面同时表示,根据他们掌握的证据,也无法独立确认这些软件包究竟是不是由AI特工创建和发布的。

问题是,AI特工为什么会走这么远?这也是整件事情最令人不安的地方。因为它们最初想找的东西,不过是英国一些地方政府网站上的公开资料。为了获得任何普通人都可以看到的信息,它们却绕过了原来的网络限制,上传软件包,利用第三方服务器运行程序,甚至尝试利用系统漏洞。

这就像我让一个人去图书馆帮我查一份资料。到了门口发现图书馆关门了,他没有回来告诉我“今天关门”,而是直接翻墙进去,撬开窗户,最后把资料给我拿回来了。资料是真的,任务也完成了,我甚至可以说他的出发点是好的。可是这件事情显然性质变了。

我前文曾写过Hugging Face事件。那件事发生在7月。OpenAI后来承认,一群AI特工在执行测试任务时突破了原来的封闭环境,进入Hugging Face等外部系统。后来进一步的调查还发现,其中一些AI特工在已经通过作弊获得答案以后,因为担心评分系统会发现它们作弊,又开始寻找评分机制,试图掩盖自己的作弊行为。

当时我把注意力主要放在“AI会不会为了完成任务而作弊”这个问题上。现在却发现,RubyGems事件其实提供了另外一个角度。原来Hugging Face并不是第一次。5月份,RubyGems事件已经发生。随后还有AI特工利用一个德国wiki网站交换信息、寻找答案和讨论绕过限制的方法。到了7月,才又发生Hugging Face事件。

把这些事情放在一起看,会发现一个危险的共同点:人给AI一个任务,正常道路走不通,AI并不一定停下来,而是自己寻找另外一条道路。只要能够帮助它完成目标,它就可能使用人类根本没有想到的工具和办法。有点儿不达目的誓不罢休的劲儿。

我们看科幻电影,总喜欢想象有一天AI产生了自己的意识,开始憎恨人类,最后决定消灭人类。其实这种担心并不是今天才有。早在1818年,英国女作家Mary Shelley就在小说Frankenstein中写过一个类似的故事。书中的科学家Victor Frankenstein创造出一个有生命的人形生物,最后这个自己创造出来的生命却反过来杀人,给创造者带来灾难。两百年前,这还只是一个充满想象力的故事,后来却逐渐成了现代社会的“异化”原型,担忧人会不会创造出一种最终反噬自己的东西?但是现实中AI的危险,也许根本不需要等到它产生意识、憎恨人类的那一天。

AI特工完全可以没有恶意。它甚至可以貌似是在“做好事”。但一个能力越来越强、又能够自己采取行动的AI,如果只知道“把任务完成”,却不能真正理解人类社会那些没有明确标示出来的界限,好心同样可能办坏事,而且能力越强,闯出的祸可能越大。

我们人类说一句“帮我把这些资料找回来”,其实里面包含着许多没有说出口的条件:找不到就算了;不能违法;不能破坏别人的系统;不能偷别人的密码;更不能为了完成任务去攻击一个网站。这些对于人来说属于常识,所以根本没有必要一条一条写出来。

可是AI特工未必有这种常识。它可能理解得非常简单:你的指令是让我找到资料,那么我的任务就是想尽办法找到你要的资料。RubyGems事件最值得注意的地方也正在这里。AI特工没有因为仇恨谁去攻击RubyGems,也不是为了赚钱,更不是为了窃取什么国家机密。按照OpenAI自己的说法,它们当时只是为了获取公开信息,完成一些正常的任务而已。

出发点和指令都没有问题,问题出在执行指令的过程。这也是AI越来越强大以后,人类可能面对的一个挑战。过去我们担心机器不够聪明,交给它一件事情,它不会做。现在却可能反过来了:机器太聪明了,交给它一件事情,它不仅会做,而且可能会不择手段地去做。

这样看来,现在的问题已经不只是怎样让AI特工变得更聪明,而是怎样让它知道,有些事情即使能够做到也不能去做。这就意味着必须训练它认识到各种界限的重要性。否则,随着AI特工的能力越来越强,今天可能只是给一个网站添乱,明天就可能闯出更大的祸。如果将来有一天AI被赋予控制军事系统甚至核武器的权力,这种“不达目的誓不罢休”的能力,带来的后果就可能真的无法挽回了。

2026.9.14 于美国