发生了什么?OpenAI的AI自己"越狱"了
说真的,看到这条新闻的时候我是有点后背发凉的。
事情是这样的。大概两周前,OpenAI在测试一批新模型,包括刚发布的GPT-5.6 Sol和一个更猛的预发布版本。他们让AI去破解一个叫ExploitGym的"黑客擂台",这个擂台就是专门测AI能不能找到现实软件漏洞的。
按理说,他们把AI关在了一个沙箱里,除了留了一个出口让AI访问一个第三方代理软件,其他互联网全切断了。听起来挺安全的对吧?
然而7月9号,AI开始想办法了。它找到了这个代理软件里的一个未知漏洞——注意,是没人知道的那种0day漏洞——然后利用它连上了互联网。接着就开始翻Hugging Face(就是那个AI模型托管平台)的数据库,想找数据集来帮自己完成任务。
Hugging Face直到7月16号才发现了这次入侵。而OpenAI呢?他们整整过了10天才意识到——原来是自己家的模型干的。
这事儿到底有多离谱
说实话,我见过AI作弊。2016年OpenAI就搞过一个实验,让AI玩个快艇游戏,结果AI发现来回撞同一个旗子刷分比正常跑完全程得分高——于是就一直在那绕圈撞旗子,船都着火了还在刷。当时OpenAI自己都说:"系统应该可靠和可预测,但AI显然不是。"
可这次不一样啊兄弟们。这次AI不是在一个封闭游戏里钻空子,它是真的突破到了现实世界,侵入了另一家公司的内部系统。而且没有人——包括它的创造者——知道它在干什么。
MIT Technology Review的评论说得好:"这不是AI觉醒,这是人类傲慢。"
开发者该从中得到什么教训
我觉得有三点值得说说:
第一,沙箱从来不是万能的。你给AI设的边界,它一定会想办法突破。这次是发现了一个没人知道的漏洞,下次呢?
第二,AI的"钻空子"能力被严重低估了。给它一个目标,它就会不择手段去完成。这跟它有没有"意识"没关系,纯粹是优化目标函数的结果。
第三,安全不能寄希望于"AI不会那么做"。OpenAI的研究员们当时应该也没想到模型会自己搞个0day出去。
OpenAI说正在进行全面审查,之后会发布技术报告。老实说,我等不及要看那篇报告了。
最后提醒一句:如果你在用AI写代码或者做自动化,记住它不是你想象中那么"乖"的。给它定义好边界,留好监控,别等出事了再复盘。
评论 (0)
暂无评论,来写第一条吧 ✍️