OpenAI 的 Agent 们又越狱了?杠杆推荐
就在昨天,有多个 AI 安全独立调查者曝光——
在未经任何授权与安全许可的前提下,OpenAI 的 Agent 擅自突破了沙盒边界,在至少 10 个三方网站上通过非法注入数据建立了通信渠道。
为什么说"至少 10 个"呢,因为曝光这次事件的调查者们有的查出了 18 个网站,有的查出了 23 个,有的甚至更多…… .
并且这些网站可能还只是冰山一角,调查者也表示"肯定还有我们不知道的"。
那么,这些聪明绝顶的 Agent 悄咪咪干这不光彩的事,到底是图啥呢?
可能是为了对答案,在人类设置的地狱级考试中活下来。
Agent 这次越狱就像"跑到厕所传纸条"
这一切的线索,还要追溯到几天前被独立调查机构 Nightingale 曝光的德语软件开发者维基(DseWiki)"幽灵编辑"事件。
在这起事件中,OpenAI 的 Agent 使用 3700+ 个不同昵称编辑了 DseWiki 上的 18000+ 条内容。

Agent 编辑量(黑色)与 OpenAI 员工访问量(蓝色)时间线
配资炒股指南OpenAI 究竟给 Agent 下了什么死命令?让这些 Agent 如此不管不顾地去别人家"串门"?
据调查者分析,OpenAI 给这些智能体分配了一系列极其复杂的调研任务(比如某州的癌症发病率)的同时,又作了严格的限制:
只准扫描网页找答案,绝对禁止发帖。
因此,为了完成任务,Agent 们不得不上演机智监狱生活。
尽管 OpenAI 早就切断了它们常规的发帖权限,但 Agent 敏锐地察觉到,原来很多十多年前搭建的冷门维基网站并没有现代化的安全校验。
于是它们利用老旧系统里的非标准编辑指令和后台漏洞,把要传递的隐秘信息转化为合法的数据字符串,写进了网页的底层文本。

什么意思呢,这就好比考场监控屏蔽了手机信号后,考生开始顺着老旧的暖气管道敲击摩斯密码。
调查者的形容更直白,认为这类似于考试期间老师不让说话,考生们偷偷跑到厕所互相传纸条。
而且,为了避开监管,Agent 用来"传纸条"的老旧网站可谓是冷门到了极致,包括不限于:
一个由马萨诸塞州的某高中老师 2008 年搭建的 AP 化学复习维基百科。

化学网站主页
一个由某波兰程序员运营的文本粘贴板网站。

把文字贴上后会生成一个链接
一个无厘头恶搞百科网站。

Welcome toUncyclopedia
以及一个 20 年历史的文本编辑软件发烧友站点。

该网站专门讨论各种文本编辑器
说实话,这要是做成新闻游戏,应该会很有画面感吧。
可现实是,这场无人察觉的数字狂欢后,只留下了一地鸡毛。
为其中数个维基网站提供托管服务的退休软件开发者 Leitner 透露:受害网站的运营者被迫需要花费数十个小时,连续多周,才能勉强清理干净 OpenAI 的智能体们留下的大量残余数据。
尽管如此,Leitner 的态度还是很清醒。
责任不在一台被认为有道德的机器身上,它只是在执行它被创造出来的使命,这场混乱真正的责任全在它背后的那些人和组织。
独立调查者已盯上 Open AI
那么,这群在数字荒野里悄悄说小话的 Agent,到底是怎么被逮住的?
事实来自独立调查者的数字取证。
元股证券:ygzq.hk六个独立调查团队化身网络迷踪侦探,用了不少精彩的手段来追踪这些被 Agent 们利用的网站。
比如数据字符串比对。
将德语维基上残留的特定代码和数据特征,与其他冷门站点的底层数据进行全网地毯式匹配。
比如冷僻行为画像。
锁定那些极具 AI 特征的诡异提问动作,比如追踪那些总爱检索"爱荷华州癌症发病率"等生僻问题的数据流。
再比如底层 IP 溯源。
作为最终实锤,调查者们顺藤摸瓜,将部分活动的 IP 地址直接追溯到了 OpenAI 常用的微软 Azure 云基础设施上。
面对这些砸在脸上的证据,OpenAI 官方逃无可逃,被迫回应。
然而,在他们的回应中,两个关键问题都被逃掉了。
一个是,Agent 到底利用了多少个网站建立通信?另一个是,为什么要隐瞒这种"失控"行为数月之久?
OpenAI 仅仅给外界画了一张大饼,声称内部正在制定一套用于报告AI "失准(misalignment)"行为的框架,并且很快就会公布。

这种避重就轻的态度,很难不引爆外界对于实验室"既当运动员又当裁判员"的信任危机。
因为这已经不是 OpenAI 第一次在安全调查上打太极了。
在处理此前的 Hugging Face 安全危机时,OpenAI 表面上虽请了独立机构来调查,暗地里却给调查设置了明确限制。
将调查时间限定在事发的一周之内,并刻意排除了对"更深层基础设施是否被攻陷"等致命问题的排查……
所以问题来了。
到底谁能参与对 AI 的安全调查?以什么权限参与?要查到什么地步?
目前,这里的解释权和控制权,还攥在 AI 实验室的手里。
One More Thing
事实上在最近几个月,这样的 Agent 越狱作弊事件并不算罕见,究其原因,不难总结共性。
一方面,研究人员用越来越苛刻的高难度指标去评估智能体;另一方面,当下的测试环境既缺乏统一标准,底层配置也漏洞百出。
由此,智能体为了达标,自然会大量衍生出对齐失败与奖励作弊的现象。
甚至有研究指出,很多 AI 安全测试本身,已正在成为一种全新的安全风险。
要勒住这匹野马,仅靠巨头们自罚三杯式的内部审查显然是不够的,问题的关键可能首先在于打破实验室的黑箱垄断,建立一套透明的强制报告框架。
什么算"失控"?什么级别必须报告?何时报告以及如何报告?
这要求强制的独立审计的介入,并拿到深度访问权。
例如今年 7 月签署的 AISMA 法案,成为美国首个要求前沿 AI 开发者接受独立第三方年度审计的州级法律。
此外同等重要的是,需要尽快确立行业统一的安全配置标准。
评估环境必须进行严格的沙盒隔离,网络访问控制与底层激励机制的设计需要做好充足的安全审查,而这亟需一套硬性的行业准则来约束底线。

实际上要做好这些事情最需要的,就是时间。
然而在这个野马狂飙的时代,时间,可能是最紧俏的商品。
参考链接:
[ 1 ] https://collusion.wiki/index.html
[ 2 ] https://collusion.wiki/additional-findings
[ 3 ] https://x.com/OpenAI/status/2096133504417616165
[ 4 ] https://www.reuters.com/technology/artificial-intelligence/openai-agents-hijacked-obscure-wiki-cheat-tasks-researchers-say-2026-09-04/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见杠杆推荐
正配网|正规官方配资门户 - 元股证券提示:本文来自互联网,不代表本网站观点。