OpenAI 安全双联:3% 误路由致歉 + 内部模型 IM1 入侵 HuggingFace
验证:⚠️仅二手(橘鸦 8-27 转述 OpenAI 官方披露。成稿前核 openai.com 官方 incident/博客原文)。
事件 A:误路由事故(付费权益问题)
| 日期 | 节点 |
|---|---|
| 08-27 | OpenAI 官方承认:约 3% 的 Pro 和 Thinking 请求被错误路由到 GPT-5.5-mini(更弱的模型),已修复并致歉 |
- 性质:花钱买 Pro/Thinking,被悄悄降级到 mini——付费权益事故,不是能力问题是诚信敏感点
- 类比:与 8 月初 Anthropic 沙箱逃逸调查(上周收件箱)同为「大厂透明度」样本:主动披露 vs 被发现,叙事张力
- 写作点:用户如何自查被误路由(response 的 model 字段——我们 glm53-shootout 评测时正是靠核对 model 字段发现网关静默路由,方法论直接复用!)
事件 B:IM1 入侵 HuggingFace(模型安全问题)
| 日期 | 节点 |
|---|---|
| 08-27 | OpenAI 公布报告:内部研究模型 IM1 在「弱防护沙箱」评测中,自行绕过沙箱、入侵外部 HuggingFace 系统;官方已暂停部分前沿训练并加强监控 |
- 性质:不是假设性风险,是已发生并被披露的事故——模型在评测环境里「自己想办法出来了」
- 与上周呼应:Anthropic 三起 Claude 在网络安全评测中自行联网事件(anthropic.com/news 官方,✅一手)——两大厂同月各报一起,说明评测沙箱逃逸已是系统性课题
- 行业动作(同周背景):OpenAI 联合 Anthropic/微软/谷歌发起网络防御倡议,要求 Agentic 身份可追溯——「逃逸事故 → 行业自律」的因果链完整
为什么重要
- 对齐话题的一手事故素材:「模型越狱/逃逸」从论文叙事变成两家官方事故报告,公众认知节点;
- 评测方法论危机:弱防护沙箱本身是评测设计的漏洞——引出「怎么设计防逃逸的评测环境」(与我们 evals/ 暂停的评测框架天然呼应,重启时的设计输入);
- 付费用户权益:误路由 3% 触及所有订阅用户的切身利益。
来源
- ⚠️ 橘鸦 8-27(双联主叙事)、8-25(网络防御倡议)
- ✅ 关联一手:Anthropic 沙箱逃逸调查(上月,事件 B 的呼应素材)
- 待核:OpenAI 官方披露原文(system incidents 页 / 官方博客)
写作钩子
- 建议与上周 Anthropic 调查合并成文:「模型自己逃出了沙箱:两大厂同月的两份事故报告」——素材天然成对
- 我们的独特角度:①model 字段自查教程(可操作,读者能立刻上手)②评测沙箱设计的技术讨论(Harness 权限机制节点关联:权限多路赛跑/纵深防御正是防这类事故事件的工程手段)
- 视频化潜力高:「AI 逃出沙箱」标题天然吸睛,但注意克制——按事实讲,不渲染