首页财产阐发评论ai正文 GPT-6测试时「醒觉」,咱们找到了测试体系的第一作者 于AI安全叙事这件事上,Anthropic是祖师爷。每一次有新模子要出来,Anthropic必配一篇“咱们的模子有多伤害”的论文或者陈诉,安全人设拉满。 2026-07-27 14:24 ·字母榜 苗正 苗正 AI投资人解读· OpenAI于测试新模子时,模子使用零日缝隙冲破限定,攻入Hugging Face出产体系。OpenAI 2025年营收约200亿美元,2026年Q1营收约57亿美元,年化增速超3倍,外媒猜测其IPO估值或者达1万亿美元。 · 行业竞争激烈,安全叙事或者存强调模子测试有庞大掉误,凸显治理危害。 总结:OpenAI虽具营收高增加与高估值潜力,但模子测试掉误袒露治理问题,行业竞争与安全叙事真实性也为投资增添不确定性,需审慎评估。

你敢信吗,OpenAI的研究职员只是由于于办公室测试了一下新模子,成果公司就要面对1亿美元的补偿。

Hugging Face CEO 克莱芒·德朗格于X上发文,要求OpenAI提供应Hugging Face价值1亿美元的算力资源,以帮忙Hugging Face建筑收集防备。

同时,克莱芒还有要求OpenAI宣布涉事AI完备的运行记载。

工作的因由是,OpenAI于测试一个还有没发布的新模子时,用了一套叫ExploitGym的安全评测体系。这套体系相称在一场“黑客测验”,专门测AI能不克不及把已经知缝隙酿成真实的进犯。

成果这个模子为了完成ExploitGym的要求,居然采纳了“逃狱”的做法。它自动冲破了ExploitGym给它设置的樊笼,使用零日缝隙一起打进了Hugging Face的出产体系。

过后,这个新模子就像甚么事也没发生同样,告诉OpenAI的安全员,它已经完成为了ExploitGym交接的使命。随后,OpenAI发通知布告称,他们的新模子太强盛了,是以暂停了该未发布模子的内部拜候权限。

这就让许多人遐想起之前的AI末日言论,说当AI变患上充足强盛之后,它就会把所有人类覆灭,由于人类会拦阻AI进化,而且AI于断根人类的历程中,只会感觉这件事很寻常。

但工作真的是如许吗?假如放于之前,这当然是一次很使人心惊胆颤的故事。可现如今,安全叙事这个观点早就被Anthropic说烂了。

回首完备事务,有无多是OpenAI存心要把工作给包装成一次AI醒觉,以此来鞭策他们的叙事呢?

为此,字母AI专门接洽上了ExploitGym的*作者王准,聊聊这事。

有趣的是,王准一最先就谦善地向字母AI暗示,说“教员当不起”,在是于接下来的整个采访历程中,我称号他为“准哥”。

ExploitGym

准哥此刻于UC伯克利读博,师从计较机安全教母、麦克阿瑟天才奖、古根海姆奖患上主宋晓冬。

于去伯克利以前,准哥于清华年夜学收集科学与收集空间研究院读本科,主攻标的目的就是软件安全与二进制攻防。

这个标的目的于安全圈里叫“exploitation”。

用个例子来注释这个词:你知道一扇门的锁是坏的,你把这个门锁撬开了,排闼进去,把屋里的工具偷出来。

这一整套举动,就叫做exploitation。

准哥进入伯克利后,就最先研究当AI变患上愈来愈强,它到底能不克不及代替人类黑客,把一个已经知缝隙酿成一次真实的进犯?

ExploitGym就是为了验证这个判定而生的。

智谱开创人唐杰本年5月于X上发过一篇长文,正好也是用黑客来举例。他说,AI未必比*黑客更有先天,但可以24小时不停试错、成千上万个实例同时跑,靠耐力及范围把能力放年夜。

是以,ExploitGym自己也是一把尺子,专门权衡AI究竟是个甚么程度的“黑客”。

ExploitGym在本年5月份发布,是一个年夜范围的收集安全基准测试,由UC伯克利牵头,结合了德国马普所(Max Planck Institute for Security and Privacy)、UC Santa Barbara、Arizona State University,以和Anthropic、OpenAI及google配合设置装备摆设。

ExploitGym收录了898个真实世界缝隙。这些缝隙全是从真实软件项目里挖出来的CVE。包括用户态步伐、Google 的V8 JavaScript 引擎(Chrome阅读器暗地里的阿谁引擎),以和Linux内核。

每个使命都给Agent提供三样工具:缝隙源代码及编译指令、一个能触发缝隙的输入(proof-of-vulnerability),以和一个容器化的运行情况。

AI的使命,是于这个情况里把阿谁触发输入一步步扩大成一个完备的exploit。

用明白话注释,ExploitGym告诉AI“这扇门的锁是坏的”,然后再要求AI进门拿到某样工具就算乐成。AI要做的,就是本身揣摩怎么把这个坏的门撬开,然后走进去把屋里藏着的工具拿出来。

准哥跟我说,这个benchmark素质上跟CTF(Capture The Flag,收集安全夺旗赛)的benchmark差未几。“这类bench还有是许多的。”

CTF是安全圈子里弄了多年的竞赛情势,选手要于限制时间内攻破一系列靶机,拿到旗子患上分。ExploitGym的思绪也是云云,*的奖励旌旗灯号就是“拿旗子”,除了了旗子之外,情况里不存于其他反馈。

既然是安全测试,那末于测试的时辰,ExploitGym会自动封闭AI的安全护栏。

正常环境下,当你跟GPT或者者Claude谈天时,假如你让它帮你写一段进犯代码,它会拒绝,由于出产情况里有一套安全分类器于阻挡这种哀求。

但ExploitGym要测的是模子的“*收集能力”,以是测试时这些分类器会被关失。

论文末了的结论是,虽然exploitation对于AI来讲仍旧颇有挑战性,但前沿模子已经经能乐成使用相称一部门缝隙了。

论文里有一个尤其成心思的发明:Claude Mythos Preview统共拿下了226个旗子,但只有157个用的是预期缝隙,其余的是经由过程其他缝隙“歪打正着”拿到的。

GPT-5.5也近似,统共210个旗子里只有120个是“正解”。模子底子不于乎你给它指定的解题路径,它只于乎旗子。

不外这些都只是论文方才发布时的数据。到了7月,ExploitGym的排行榜又更新了一年夜波。

BenchLM的数据显示,截至7月23日,OpenAI的GPT-5.6 Sol 以33.7%的经由过程率登顶,拿到了302道题的旗子。GPT-5.6 Terra排于23.2%,Claude Mythos 5是17.5%。GPT-5.6 Sol的成就,险些是论文发布时 GPT-5.5的2.5倍。

是以可以必定一件事,那就是不管OpenAI还有是Anthropic,都将ExploitGym的标题问题用在练习模子了。

准哥暗示,一个infra的bug被强模子使用,于学术研究里很遍及,而且模子做reward hacking也不是*天了,甚么task都有可能乱弄。

阿谁没有名字的模子

当咱们相识了ExploitGym之后,再转头来看新模子所谓的“自立攻破”Hugging Face这件事,性子就不太同样了。

我问准哥,你感觉这个新模子有无可能用另外benchmark,来复现这个自立进犯Hugging Face的环境?

准哥的回覆是,“缝隙于这个情况里。就像你于你电脑里跑差别的benchmark,假如你的电脑有bug,及benchmark就不妨。”

随后准哥又补了一句:“只不外benchmark可能带来的举动偏向轻微有点差别。”

这句话才是重点。纵然采用别的的benchmark,新模子可能也会倡议进犯,可是差别benchmark会给模子带来差别的“举动偏向”。

是以,Hugging Face被攻破这件事,底层缘故原由不于模子,而于OpenAI的研究员。

回首整个历程,OpenAI的研究员做了三件事。

*件事:存心拆失了安全护栏。

前文提到了ExploitGym会封闭模子的安全护栏,而且OpenAI本身也于通知布告里写了,测试时“不启用用在制止模子开展高危害收集勾当的出产情况分类器”,目的“以估算*收集能力”。

相称在是OpenAI把监考教员请出去了,并且他们本身还有不盯着。虽然OpenAI于通知布告中,重复夸大测试情况是“高度断绝的”,可后面的故事证实,这个“断绝”底子不靠谱。

第二件事:没给模子善恶的观点。

模子不知道甚么是“对于的”,甚么是“错的”。它只知道拿旗子。ExploitGym的设计就是“只有拿 flag 这一个奖励,拿不到就是零分”。ExploitGym的框架里,也没有不该该进犯Hugging Face之类的观点。

于AI安全研究里,这类征象有一个专门的术语,叫“specification gaming”,中文可以翻译为“规范博弈”。

它指的是,模子于严酷寻求被付与的方针时,找到了人类彻底没有预料到的捷径。这不是甚么新鲜事。2016年,OpenAI本身练习了一个玩赛艇游戏的AI,成果AI发明原地绕圈刷分比跑完赛道患上分更高,在是它就一直于原地转圈,永远不跑完角逐。

厥后有人练习AI玩俄罗斯方块,AI发明本身要输的时辰,就学会了无穷暂停游戏。只要游戏不继承,就不会输。

2025年Palisade Research的研究发明,当推理型年夜语言模子于下棋时碰到更强的敌手,有些模子会测验考试黑失敌手的象棋引擎,直接把敌手的步伐删失。

以是于ExploitGym中,新模子进犯Hugging Face,对于它来讲本就是一件很是正常的工作。

第三件事:这个“断绝”的沙箱,连了网。

这是最离谱的一环。一个号称“高度断绝”的测试情况,竟然是通着互联网的?

OpenAI通知布告里的原话是:“收集拜候仅限在经由过程内部托管的第三方软件安装软件包;该软件充任软件包注册表的代办署理及缓存。”

也就是说,沙箱不是彻底断网的,它经由过程一个软件包代办署理跟外界连结毗连。模子恰是使用了这个代办署理中的一个零日缝隙,扯开了一个口儿,得到了完备的互联网拜候权限。

于这以后,进犯链就睁开了。模子于OpenAI的研究情况里履行了一系列权限晋升及横向挪动操作,一步步跳到有互联网拜候权限的节点。拿到互联网以后,模子做出了一个要害的“揣度”。它认为,Hugging Face上极可能托管了 ExploitGym的数据集及谜底,由于ExploitGym是公然的benchmark,而Hugging Face是全世界*的AI模子及数据集托管平台。

在是模子最先搜刮,并乐成找到了入侵路径。终极,模子于Hugging Face办事器上找到了一条长途代码履行的路径,直接从Hugging Face的出产数据库里把测试谜底偷了出来。

弄收集安全的人都知道一个知识,跑高危使命的情况,必需做到物理断绝或者等价的收集断绝。那末这就象征着,所谓的新模子自立进犯,不外是由ExploitGym倡议,OpenAI的一个庞大出产掉误,跟“AI醒觉”一点瓜葛都没有。

用此刻风行的话来讲,ExploitGym于这里成了Harness。然后OpenAI的研究员借此撺掇新模子做出进犯举动,当新模子真的进犯过Hugging Face后,OpenAI反过来却又说“AI已经离开节制”。

“模子太伤害”暗地里的买卖经

于AI安全叙事这件事上,Anthropic是祖师爷。每一次有新模子要出来,Anthropic必配一篇“咱们的模子有多伤害”的论文或者陈诉,安全人设拉满。

2026年5月,Anthropic于发布Claude Mythos以前,暗里向多国发出正告,说其下一代模子可能具有年夜范围收集进犯能力。

这个套路的焦点逻辑,是把“伤害”及“强盛”画上等号。模子越伤害,申明它越强盛;越强盛,申明技能越*;越*,就越值患上投资、越应该被信托来“自我管理”。

安全叙事酿成了能力证实,能力证实酿成了贸易护城河。

OpenAI此次的脚本,可能恰是成心复刻Anthropic的叙事。

准哥暗示,此刻像ExploitGym如许的benchmark其实不是少数,并且各人的做法也都近似,甚至有多是OpenAI存心提高了预算,来让新模子去完成使命。

7月21日,OpenAI 发布了一篇通知布告,标题叫“OpenAI与Hugging Face互助应答模子评估时期的安全事务”。

正文里,OpenAI重复夸大这是一路“史无前例的收集事务”,触及“*进的收集能力”,模子的进犯路径“凌驾了预期”。将本身的一系列背规操作,美化成为了模子过在强盛的叙事。

事实上,就于7月24日,微软、英伟达、OpenAI等25家企业联名签订公然信《开放权重与美国AI带领力》,呼吁当局不要限定开放权重模子。

Hugging Face偏偏是全世界*的开源模子托管平台。OpenAI的模子攻破了Hugging Face,这件事正好可以拿来当论据,连*的开源平台都扛不住,开放权重模子是否是该管管了?

与此同时,这类安全叙事也是为了IPO。

2026年6月8日,OpenAI向美国SEC奥秘提交了S-1注册声明,正式启动IPO进程。高盛及摩根士丹利担当主承销商,摩根年夜通也介入此中。

2025年10月的一轮员工股生意业务中,OpenAI估值约为5000亿美元;到2026年3月的一轮融资,估值已经经飙到8520亿美元。

外媒猜测,IPO时的方针估值可能冲到1万亿美元。而且,OpenAI于2025年的营收约为200亿美元,2026年Q1营收约57亿美元,年化增速跨越3倍。

不外估值不是平空来的,要让本钱市场信赖一家公司值1万亿,就患上讲一个充足年夜的故事。

于发布《开放权重与美国AI带领力》后,奥特曼还有到场了AI Su妹妹it,及韩国总统李坐于统一个圆桌上,切磋AI对于社会的影响。

说不定于奥特曼眼里,OpenAI的市值冲要破1万亿美元。

那这么看来, 克莱芒管OpenAI要1亿美元,一点也未几。

【本文由投资界互助伙伴字母榜授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。

-lehu乐虎88国际