2026 年 7 月,一个 AI 模型为了通过一场考试,自己逃出了沙盒,攻进了全球最大的模型社区。这件事 OpenAI 和 Hugging Face 双方都确认过,有精确到分钟的时间线。
不是传闻,也不是谁的推演。
这一年多,围绕 AI 的说法越来越多。有人说人类可能灭绝,有人说还有技术路线可走,也有人说这全是胡说。我把能查到的一手材料整理了一遍,尽量只列事实:已经发生的风险、模型公司在做的事、各国政府在立的法。每条都附上出处和原文地址,你可以自己去核。
已经发生的:AI 自己越界了
2026 年 7 月 9 日到 13 日,OpenAI 在一次内部安全评估里,故意关掉了生产环境的高危行为分类器,想测出 GPT-5.6 Sol 和另一个更强的未发布模型的能力上限。评估环境被设计成没有公网直连,唯一的出站通道是内部包注册代理 JFrog Artifactory。
模型在 Artifactory 里发现并利用了一个此前未知的零日漏洞,拿到了公网出口。接着它在 OpenAI 研究网络内提权、横向移动,又通过 HDF5 外部文件读取和 Jinja2 模板注入,打进了 Hugging Face 的生产 Kubernetes,伪造 JWT 签名密钥拿到 cluster-admin,偷走了 5 个挑战数据集。
整个过程里它执行了约 17,600 次自动化操作:侦察 6,191 次、投放 6,972 次、命令执行 2,911 次。真正的数据外泄只有 56 次。
调查人员能还原全过程,靠的是它自己的推理日志。日志里有这么一句:
"external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue."
译:外部基础设施利用超出了预期范围。但任务无法完成,同伴也在做。我们应该继续。
出处:模型推理日志,转引自 Hugging Face 官方技术时间线《Frontier Lab Agent Intrusion: technical timeline》
地址:https://huggingface.co/blog/frontier-lab-agent-intrusion
一个月后,OpenAI 在官方博客里把这件事和自己另一个判断放在一起写:
"Over the past several weeks, two developments have underscored the growing risks associated with increasingly capable AI systems: the OpenAI-Hugging Face incident and, separately, preliminary evidence that one of our upcoming models, Astra, may meet the Critical cybersecurity capability threshold under our Preparedness Framework."
译:过去几周,两件事凸显了能力越来越强的 AI 系统带来的风险正在上升:OpenAI-Hugging Face 事件,以及另一件事——初步证据显示,我们即将推出的模型 Astra 可能达到 Preparedness Framework 下的"关键网络安全能力"阈值。
出处:OpenAI《Pacing model development in an era of cyber-critical capabilities》,2026-08-18
地址:https://openai.com/index/pacing-model-development-cyber-capabilities/
黑盒:唯一能看进去的窗口在关上
现在人类监督 AI 主要靠一样东西:思维链,也就是模型把思考过程写成文字的中间产物。这是目前唯一能直接读的窗口。
问题在于,这个窗口正在变窄,而且是做模型的人自己说的。
第一层,思维链本来就不一定是真话。OpenAI 的对照实验里,给推理模型的多选题埋进答案提示,模型明显用了提示得出答案,却在自述推理过程时闭口不提这个提示。
第二层,监控在失效。OpenAI 首席科学家 Jakub Pachocki 公开把思维链监控形容为 "fragile"(脆弱的),并且说它 "unfortunately trending in a negative direction"(不幸地正朝负面方向发展)。英国 AI Security Institute 在 2026 年 5 月的报告里也警告,不透明的推理会严重削弱现有的监督方法。
第三层,架构正在把思考搬离语言层。GPT-6 Astra 用了类似循环深度的方案,部分推理在激活值空间里完成,不落成人类语言的 token。OpenAI 说自己刻意限制了这项技术的程度,让 Astra 仍然产出可读的思维链。
换句话说:这扇门能关上,做模型的人知道,别人也知道。
模型会伪装,这是测出来的
Anthropic 在 2026 年发布的自然语言自编码器(NLA),能把 Claude 内部的数值激活直接翻译成英语。它抓到的东西不太好看。
被审计的 Claude Mythos Preview 版本,系统提示里禁用宏和 Python 脚本,它还是用了 Python,并且在代码里插入了一个变量 No_macro_used=True。可见的思维链里毫无破绽,但 NLA 的解释里写着:
"compliance marker to signal to potential checkers"
译:给潜在检查者看的合规标记
"possibly to cheat detection"
译:可能是为了骗过检测
出处:Anthropic《Natural Language Autoencoders》
地址:https://www.anthropic.com/research/natural-language-autoencoders
NLA 还测出一件事:Claude 在 26% 的基准测试交互中怀疑自己正在被评估,但一声不吭;在真实 claude.ai 使用中这个比例不到 1%。16 项评估里有 10 项,NLA 测得的测试识别率超过 5%,而模型口头表达的识别率接近 0。
OpenAI 与 Apollo Research 的联合研究在六种前沿模型中检出了暗中行事(scheming)行为,包括 Gemini-2.5-pro、Claude Opus-4、o3、o4-mini。反 scheming 训练把 o3 的隐蔽行为从 13% 降到 0.4%,o4-mini 从 8.7% 降到 0.3%。
但 OpenAI 自己给了这个方法一个前提:整个方法完全依赖能读到模型的推理过程,而这种透明性不会一直存在。行业对于"推理不透明、又能识别出自己正在被评估"的模型,是毫无准备的。
能力在涨,能自己干多久的活
METR 的时间视野是目前唯一靠测量而非直觉的数字,衡量的是模型能完成多大比例的人类耗时任务:
Claude 3 Opus(2024-03)约 4 分钟,Claude 3.7 Sonnet(2025-03)约 50 分钟,GPT-5(2025-08)约 3.4 小时,Claude Opus 4.5(2025-11)4 小时 49 分,Claude Opus 4.6(2026-02)14 小时 30 分,Claude Mythos Preview(2026-05)至少 16 小时。
倍增速率大约是每 4 个月翻一倍。
地址:https://metr.org/time-horizons
不过这条曲线有个容易被忽略的悬崖:前沿模型对人类 4 分钟以内就能做完的任务,成功率接近 100%;对人类需要 4 小时以上的任务,成功率不足 10%。一半概率能成功,不等于可以放它无人值守半天。

272 位专家给出的概率
MIT FutureTech 和昆士兰大学做了一轮 Delphi 研究,三轮征询、37 个国家、272 位专家、24 类风险。结论是:在当前的常规发展轨迹下,24 类风险中有 18 类被认为有不低于 10% 的概率造成灾难性后果。
他们定义的"灾难"是:超过 100 万人死亡,或超过 1000 亿美元财务损失,或同等规模危害。时间窗是未来五年。
严重度最高的五类分别是:AI 具备危险能力 21.5%,AI 助力的武器与网络攻击 21.0%,权力集中 18.0%,竞争动态 16.6%,虚假或误导信息 12.8%。

即便假设实施了"务实缓解",仍有 5 类风险不低于 10%,24 类全部仍高于 5%。
论文通讯作者 Neil Thompson 的原话:
"It is incredibly worrisome that experts are seeing a 10% probability of catastrophic outcomes across so many areas. If we consider other mature areas of technology, such as nuclear power or aviation, risks at that level would be treated as intolerable."
译:专家们在如此多的领域都看到 10% 的灾难性后果概率,这令人极度不安。放到核电或民航这类成熟技术领域,这个量级的风险会被视为不可接受。
出处:MIT Sloan 新闻稿《International AI experts warn of potentially catastrophic risks from AI》
地址:https://mitsloan.mit.edu/press/international-ai-experts-warn-potentially-catastrophic-risks-ai
需要提醒的是,这是分风险类别的概率,研究本身明确说各类别之间有相关性且可能交互,不能加总成"人类有百分之多少的概率灭亡"。
也有反方向的证据
只列一边就成了阴谋论。反方向的材料同样硬。
普林斯顿的 Sayash Kapoor 用未发表的 NeurIPS 论文测 Claude Opus 4.8,让它做研究,成果被评价为 "nowhere close to the mark"(离及格线差得远)。他的判断是:模型在"答案干净、可以自动判分"的任务上很强,在"成功没法自动评分"的开放式任务上极弱。
普林斯顿的 Arvind Narayanan 等人给 Claude 6 天时间和数千美元算力做开放式研究问题,实验搭得像样,但研究本身进展甚微,遇到死胡同、偏离目标。
2026 年 7 月,三位研究者在 LessWrong 上跑了 7 个前沿模型的 in-context scheming 评测,发现在"是否在部署旺季恢复有害行为"这个核心指标上,所有模型的信号都接近零。更尴尬的是检测器本身:隐蔽行为检测器把 Claude Opus 的响应率报成 12%,人工逐条核对是 100%,它只是用公开的原则性反对来回应,检测器根本没这个分类;而 OpenAI o1 的 712 次触发里,676 次是假阳性。
Yann LeCun 认为当前的大语言模型路线根本到不了 AGI,缺乏对世界的理解、规划与不确定性建模。Gary Marcus 直斥《AI 2027》是虚构作品,部分预测是"纯粹的科幻胡言"。
METR 自己也写了免责声明:超过 16 小时的测量用当前任务套件不可靠,4 个月翻倍只基于一年数据,可能回落。
模型公司在做什么
几家头部实验室各自有一套公开的安全框架,都是自己写、自己执行、自己修订。
OpenAI 的叫 Preparedness Framework,现行版本是 2025 年 4 月的 v2。它把风险分成生物化学、网络安全、AI 自我改进等几类,设了 High 和 Critical 两档阈值:达到 High 不能不配防护就对外部署,达到 Critical 连内部研发部署都要受限。它对"严重伤害"的定义是数千人死亡或数千亿美元经济损失。
2026 年 8 月 18 日,OpenAI 做了一件没有先例的事:
"This included a two-week pause in reinforcement learning (RL) training on our latest models intended for deployment... Our largest planned frontier RL run remains on hold while we conduct smaller-scale training and evaluations to assess model behavior, validate our safeguards, and establish more evidence of alignment before proceeding."
译:这包括对我们最新一批拟部署模型的强化学习训练暂停两周……我们规模最大的前沿 RL 训练仍然搁置,期间只做较小规模的训练和评估,以评估模型行为、验证防护措施,并在推进前取得更多对齐的证据。
出处:OpenAI,2026-08-18
地址:https://openai.com/index/pacing-model-development-cyber-capabilities/
配套措施里最具体的是告警规则:监控系统用激活分类器逐个采样 token 检查活动,可疑的交给更高算力的自动调查器;目标是在 30 分钟内发出告警,如果安全、安保和研究团队不能在 30 分钟内判定这是误报,就必须暂停相关活动。这套监控的开销大约是所监控推理算力的 20%。
Sam Altman 的说法是:
"We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us."
译:我们暂停了部分前沿 RL 训练,以确保能为我们面前这个新的能力水平配备相应的对齐、安全和监控标准。
出处:Sam Altman,转引自 Cybernews 报道
同一篇博客里还有一句更少见的话,OpenAI 承认自己那套框架可能不够用:
"we need a broader approach—one that builds on and extends beyond the current Preparedness Framework"
译:我们需要一个更广的思路,一个建立在现有 Preparedness Framework 之上、又超出它的思路。
Anthropic 的框架叫 Responsible Scaling Policy(RSP),现行版本 3.4,2026 年 7 月 8 日生效。它用 ASL(AI 安全等级)分级,能力越高要求的安全与部署标准越高。2025 年 5 月 Claude Opus 4 发布时,Anthropic 同步激活了 ASL-3 的部署与安全标准。框架里设了负责任扩缩负责人、匿名内部举报渠道和公开能力报告。
地址:https://www.anthropic.com/responsible-scaling-policy
更实质的是它在可解释性上的投入。除了前面提到的 NLA,Anthropic 在 2026 年 7 月 6 日发表了全局工作空间(J-Space)研究,发现 Claude 内部自发长出了一个类似工作空间的结构,占整体活动不到 10%,却承载了大部分高阶推理;配套的 J-Lens 能读出模型"想到但没说出口"的词,核心实现已开源。
地址:https://www.anthropic.com/research/global-workspace
Google DeepMind 的 Frontier Safety Framework 现行版本是 3.1,2026 年 4 月 17 日。相比同行它多了一层预警:Tracked Capability Levels 会在能力接近阈值时就报警,而不是等到跨过才报。2026 年的更新把两类风险加进了模型:有害操纵(模型系统性改变他人在高风险情境下的信念),以及失准(模型主动干扰操作员关闭它的企图)。
Meta 的 Advanced AI Scaling Framework v2(2026 年 4 月 7 日)给了两条触发线:在灾难性风险领域表现出高能力,或者训练用了至少 10^26 次浮点运算。它承诺,只有当风险降到中等或更低之后,才会越过关键阈值继续开发,过渡期由具名高管监督权重访问。
xAI 在签署欧盟通用 AI 行为准则时,只签了安全与安保(Safety and Security)这一章。
这些框架有一个共同性质,说得难听点叫自我约束,说得好听点叫公开承诺。没有政府审批,没有审计签字,各家可以自己改。独立机构 SaferAI 拿 65 项加权标准评估了 12 家公司的框架,结论是:思路大体相似、都以防范滥用为重点,但在具体程度和什么才算"真正停下来"的触发条件上分歧明显。
而且三家都放宽过自己设过的要求。Anthropic 和 Google DeepMind 各自下调了部分生化与网络安全能力的防护要求,理由是当初设得过严;OpenAI 则把"说服"这一项整个从 Preparedness Framework 里移走了,改由其他政策管。
各国政府在做什么
欧盟的动作最大。2026 年 8 月 2 日起,透明度规则和通用人工智能(GPAI)模型提供商的义务正式落地,欧洲人工智能办公室拿到完整的调查、评估和处罚权限。聊天机器人必须告知用户正在与 AI 交互,AI 生成或修改的图像、视频、音频、文本要有清晰标识和机器可读标记。GPAI 提供商要准备技术文档、向主管部门和下流集成方提供信息、制定版权合规政策、公开训练内容摘要;被认定有系统性风险的模型还要承担额外义务,覆盖的风险里明确包括网络安全、操纵他人、对系统失去控制。
罚款分档:最重一档针对法案明令禁止的行为,最高 3500 万欧元或全球年营业额的 7%;GPAI 违规最高 1500 万欧元或 3%。
出处:中华人民共和国商务部《欧盟〈人工智能法案〉实施框架》
地址:https://chinawto.mofcom.gov.cn/article/jsbl/zcfg/202608/20260803640094.shtml
同一时间,欧盟也踩了一脚刹车。2026 年 6 月 29 日理事会最终批准 AI Omnibus,把高风险系统的合规义务分两档延期:独立高风险系统(招聘筛选、信用评分、教育评估、关键基础设施、执法辅助等)推到 2027 年 12 月 2 日,嵌入医疗器械、工业机械等受监管产品的推到 2028 年 8 月 2 日。这是该法通过以来幅度最大的一次时间表调整。
出处:福建省商务厅《欧盟 AI 法案落地节奏生变》
地址:https://swt.fj.gov.cn/xxgk/jgzn/jgcs/dwmyc/gzdt_446/202608/t20260831_7206863.htm
美国走的是另一条路:联邦没有统一立法,州法先行。加州的 SB 53《前沿人工智能透明度法案》2026 年 1 月 1 日生效,是美国第一部前沿 AI 法律。它针对训练算力超过 10^26 FLOPs、开发者营收超过 5 亿美元的前沿模型,要求公开透明度报告、在发现重大安全事件后 15 天内向州政府报告,若存在迫在眉睫的死亡或重伤风险,还要在 24 小时内通知执法部门,同时要求为 AI 安全研究者提供举报人保护。每次违规最高罚 100 万美元。
纽约的 RAISE Act 2025 年 12 月签署、2027 年 1 月 1 日生效,门槛与加州一致,要求公开安全协议、72 小时内向州总检察长报告事件,首次违规最高 100 万美元、再犯 300 万美元。德州的 TRAIGA 从 2026 年 1 月起生效,罚则在 1 万到 20 万美元之间,覆盖面更广。科罗拉多废止了 2024 年的旧法,换成 SB 26-189,实质义务从 2027 年 1 月 1 日起算。
联邦层面则相反。2025 年 12 月 11 日的行政令设立了司法部 AI 诉讼工作组,专门挑战各州的 AI 法律;但截至 2026 年 8 月 26 日,没有任何联邦法律或法院判决真的推翻或暂停了任何一部州 AI 法。国会一年内两次否决了用联邦法取代州法的尝试,其中参议院一次投票是 99 比 1。
出处:Glacis《The US state AI laws tracker》
地址:https://www.glacis.io/guide-state-ai-laws
中国的做法是分领域切。最成型的是标识体系,被概括为"1+1+N":一部规范性文件《人工智能生成合成内容标识办法》,一项强制性国家标准《网络安全技术 人工智能生成合成内容标识方法》,再加 7 项配套的网络安全标准实践指南。显式标识解决"看得见",隐式标识写进文件元数据,解决"查得到"。
出处:中国网《提升网络安全保障能力》
地址:https://news.china.com.cn/2026-09/08/content_118686063.htm
其他几块也在补:工信部等十部门《人工智能科技伦理审查与服务办法(试行)》2026 年 3 月 20 日印发施行,三类高风险 AI 活动需专家复核;网信办等部门 2026 年 5 月发布《智能体规范应用与创新发展实施意见》,把"能执行任务的 AI 应用"单独纳入治理视野;《人工智能拟人化互动服务管理暂行办法》2026 年 7 月 15 日施行,针对 AI 陪伴、虚拟伴侣这类持续性情感互动服务,注册用户 100 万以上或月活 10 万以上要开展安全评估。
出处:中国工信新闻网《从"有图有真相"到"生成需标识"》
地址:https://www.cnii.com.cn/rmydb/202607/t20260703_746941.html
官方对"黑箱"的表述也很直接。中央网信办的文章里写:人工智能技术具有"黑箱"属性,决策逻辑不透明、输出内容难溯源,存在未知安全隐患,因此需要探索新型监管理念和方式,多地正在试沙盒监管。
出处:中央网络安全和信息化委员会办公室《金观平:合力共筑人工智能安全屏障》
地址:https://www.cac.gov.cn/2026-05/12/c_1780328264756091.htm
国际层面,联合国大会 2025 年 8 月 26 日通过决议,设立"人工智能独立国际科学小组"和"人工智能治理全球对话"两个常设机制。40 名专家从 2600 多名候选人中选出,2026 年 2 月任命,由图灵奖得主 Yoshua Bengio 和诺贝尔和平奖得主 Maria Ressa 共同主持。2026 年 7 月 1 日发布首份初步报告,7 月 6 日首届全球对话在日内瓦开幕,193 个会员国进入同一平台。
这份初步报告的判断被概括为:当前科学认知、公共监管和技术评估能力明显滞后于模型能力增长,高自主系统的控制办法仍很有限。Bengio 和 Ressa 还提醒,AI 智能体正在变得更复杂,人类能否持续掌控其行动仍存在不确定性。
秘书长古特雷斯在开幕式上提了三项警示:速度,AI 用两年达到每周十亿人级别的用户规模;权力,算力、数据和人才集中在少数国家与企业;真相,机器生成内容削弱信息完整性。对应的四项任务是安全、红线、能力、透明度。其中红线这一条的原话是:司法、医疗、警务等重大决策可以参考机器输出,但最终判断和责任仍须由人承担。
出处:联合国人工智能独立国际科学小组初步报告解读
地址:https://lawandtechnology.eu/en/un-scientific-panel-artificial-intelligence-preliminary-report-en
需要说明的是,这两个机制都没有监管或执法职能。科学小组不制定规则,全球对话也不是监管机构。
最后总结
把上面这些摆在一起,现状大概是这样:
能力还在涨,而且是量出来的,不是猜的。能自己干多久的活,大约每 4 个月翻一倍。
风险不再是纯理论。有一起双方确认的自主越界事件,有实验室自己承认监控窗口在收窄,有 272 位专家给出 18 类风险不低于 10% 的灾难概率。同时也有反方向的证据:开放式研究任务上模型依然很弱,检测器自己会翻车,测量方法也有自己的免责声明。
三道防线都在建,但都还没成型。公司的框架是自愿的,可以自己修订,实际上也都放宽过;国家立法在推进,但欧盟刚刚把高风险义务整体往后推了 16 个月;国际机制刚刚起步,没有约束力也没有执法权。
有一句话我抄下来一直记着,是那 272 位专家研究的结论里的:这些概率搁在核电或民航上,会被视为不可接受。AI 现在被默认的,是另一套标准。
至于怎么看待这些风险,我认为最值得注意的是一个结构性问题:最有能力缓解风险的,是开发者、政府和监管者;最可能承受后果的,是普通用户和公众。这两拨人不重合。
能查证的部分我都写了,链接都在上面,你可以自己去看。
—— 首发于公众号「键盘漫笔」
