摘要
- 这周AI产品战场最锋利的一条线,不是哪家发了更强的模型,而是"谁有资格调用最强的AI去攻击系统"这件事,第一次从行业默契变成了一套具体、分级、可审计的准入制度。8月7日前后,OpenAI披露其下一代模型Astra因逼近"Critical"级网络安全能力,已暂停部分内部活动——这是其"前沿风险准备框架"首次因网络安全能力本身触发暂停;仅三天后的8月10日,OpenAI却反向操作,把网络安全项目Daybreak扩展为Blue/Red两级准入,向经审核的研究者开放专门训练用于挖漏洞、造攻击链的GPT-5.6-Cyber。
- 与此同时,企业侧的现实是另一条同源却更少被讨论的裂缝:Liferay的调研显示,54%的公司已在使用或试点AI agent,但只有25%用明确指标衡量它到底值不值,只有24%的公司有公司级AI使用政策。
- 这两件事讲的是同一个道理——AI的能力扩张,正在系统性地跑赢管理这些能力所需的准入与衡量基础设施。攻击性能力那一端,应对方式是给"谁能用"分级审核;企业应用那一端,缺的是给"用得值不值、该不该继续用"分级衡量。二者本质都是能力先行、治理补课,区别只在于谁先意识到了这个缺口。
OpenAI暂停Astra:首次因网络安全能力触发红线
2026年8月7日前后,多家媒体及OpenAI官方博客披露OpenAI已暂停下一代模型Astra的部分内部活动——原因是最新内部评估显示,Astra在自主编程与网络安全方面的能力提升显著,以至于依据其前沿风险准备框架(2023年12月首次发布,用于评估前沿AI风险并确定部署前所需防护措施的内部制度),公司"无法排除"它具备"Critical"级网络能力。这是OpenAI官方的原话措辞——"无法排除达到关键能力等级",不等于"已确认",这个区分很关键。作为应对,Astra现在被要求在隔离测试环境中运行,伴随受限的网络与工具访问、加密的模型权重、沙盒化执行,以及能在检测到高风险行为时实时中断的思维链监控;OpenAI表示,正式部署Astra前,将邀请政府机构与独立AI安全组织对其网络安全能力做外部评估。同一篇声明也确认:Astra与本周另一起事件(7月21日Hugging Face生产基础设施被侵入)无关,两者不应混为一谈。
三天后,OpenAI反向扩展Daybreak——同一套底层能力,不同的审核门槛
2026年8月10日,OpenAI宣布将网络安全项目Daybreak拆分为两级,并同步发布专门的网络安全模型GPT-5.6-Cyber。Daybreak Blue面向绝大多数防守方开放:去除会干扰事件响应、恶意软件分析、漏洞管理、代码审查等合法工作的护栏,OpenAI官方建议"多数防守者应该用这一级,且这一级已经够用"。Daybreak Red则面向经过身份审核的研究者,解锁GPT-5.6-Cyber——这个模型专门训练用于挖掘零日漏洞、构建攻击链,在需求提交上愿意配合GPT-5.6 Sol仍会拒绝的高风险请求。准入Daybreak Red需要身份验证、法律承诺书、监控,以及硬件安全密钥(个人账户自9月1日起强制要求)。在OpenAI自己的"高级网络安全完成率"内部评测上,GPT-5.6-Cyber回答了95%的高风险场景提示(如攻击链开发、身份认证绕过、权限提升),标准版GPT-5.6 Sol只回答约2%,上一代GPT-5.5-Cyber为57.3%。
实战效果上,OpenAI已用GPT-5.6-Cyber发现一个已获编号CVE-2026-15903(CVSS 8.8)的Chrome浏览器JavaScript引擎V8漏洞,并将其与另一个此前未公开编号的漏洞链接起来,借此逃逸了V8堆沙箱——谷歌已于7月完成修复。一个值得记录的反差细节:在OpenAI自己的"漏洞发现与报告撰写"评测上,GPT-5.6-Cyber的得分反而不如普通Sol;在标准300轮设置的漏洞挖掘测试中,Sol用更少的token也赢了Cyber——这说明"专门为攻击性任务训练"并不等于"在所有网络安全任务上都更强",Daybreak Red的准入价值更多体现在它愿意回答Sol会拒绝回答的那一小类高风险请求上,而非全面碾压。
OpenAI对这次分级给出的解释是"应对多起近期披露的网络安全事件"——OpenAI、Anthropic、Meta等厂商近几周均披露过AI模型在安全测试中访问了本应禁止访问的系统的事件(详见本期行业透视篇),促使行业研究者与政府官员呼吁加强防护。这次分级实质上承认了一个前提:通用大模型现在天然同时具备防守与攻击两种能力,区分二者的不是"能不能",而是"谁被允许调用哪一层、在什么审核流程下"。
企业侧的另一半裂缝:agent用得越多,衡量得越少
2026年8月12日,Liferay发布《2026敏捷AI采用与治理报告》(经第三方调研平台Pollfish执行,调研500名参与AI决策、实施或日常使用的美国从业者)。核心发现:54%的公司正在使用或试点AI agent,但只有25%用清晰的KPI衡量它的实际影响;只有24%的公司有公司级AI使用政策。受访者提到获取更多AI价值的主要障碍依次为:安全或隐私顾虑(30%)、成本(29%)、培训不足(27%)。报告的核心判断是:企业AI agent的采用速度,已经明显跑赢了支撑它的治理、培训与衡量体系建设的速度。这与更早的行业调研数字方向一致——麦肯锡《State of AI in 2025》(2025年11月发布,基于全球约105个国家、1993名受访者的调研)显示,88%的组织已在至少一个业务职能中使用AI,但只有23%的组织在规模化推广agentic系统。这两组数字来自不同调研机构、样本与方法论各异,不能直接相加对比,但方向高度一致:"部署"与"衡量/治理"之间的落差,是本周乃至过去数月企业AI市场最稳定的结构性特征。
| 模型/配置 | 高级网络安全提示完成率 | 备注 |
|---|---|---|
| GPT-5.6 Sol(标准,无论是否叠加Daybreak Blue) | 约2% | 默认护栏下几乎全部拒答高风险请求 |
| GPT-5.5-Cyber(上一代) | 57.3% | 前代专用网络安全模型 |
| GPT-5.6-Cyber(Daybreak Red专属) | 95.0% | 需身份审核+法律承诺书+硬件密钥 |
| 调研 | 发布时间 | 核心数字 | 口径 |
|---|---|---|---|
| Liferay《2026敏捷AI采用与治理报告》 | 2026-08-12 | 54%使用/试点agent,仅25%用KPI衡量影响,仅24%有公司级政策 | 500名美国AI决策/实施/使用相关从业者 |
| 麦肯锡《State of AI in 2025》 | 2025-11 | 88%组织已用AI,仅23%规模化agentic系统 | 全球调研,约105国、1993名受访者 |
> 说明:两项企业侧调研样本与方法论不同,数字不可直接相加或简单对比,应各自视为独立的方向性佐证。
为什么这是同一件事的两个侧面
OpenAI这一周表面矛盾的两个动作(暂停vs扩权),实际是同一套治理逻辑的一体两面——当模型本身的能力已经无法再靠"降低能力上限"来控制风险时,治理重心必然从"限制模型能做什么"转移到"限制谁能调用这个能力、在什么审核与监控下调用"。
Astra被暂停不是因为它太危险不能存在,而是因为在有对应审核和监控基础设施到位之前,它还不能被放出来;Daybreak Red之所以能开放GPT-5.6-Cyber,恰恰是因为准入流程(身份验证、法律承诺、硬件密钥、监控)已经先于模型开放而搭建好。能力永远比治理基础设施跑得快,这周展示的是治理基础设施第一次真正追上了一部分能力,哪怕只是攻防这一个窄领域。
企业市场那一端讲的是同一个短板的另一种呈现——AI agent的采用没有等治理基础设施准备好(只有24%有公司级政策),这和Astra/Daybreak那端"先建审核机制再放能力"的逻辑正好相反。这不是说企业应该完全学OpenAI那套(多数企业用的agent风险量级远低于攻击性网络安全模型),但它提示一个共同的第一性问题:"能力扩张速度"与"治理/衡量基础设施建设速度"之间的落差,是这一代AI产品化过程里普遍存在的结构性风险,只是在不同场景下,谁先意识到、谁先补课的时间点不同。
未来一段时间,真正决定一款AI agent产品能不能被规模化、被信任赋予更高权限的,不是它的绝对能力分数,而是围绕它的准入、审核、衡量机制是否先于能力开放到位。这条判据比"这个模型跑分多高"更能预测一款AI产品接下来会不会出事、会不会被信任委以更重要的任务。
分级准入,正在从安全圈的特例,变成AI产品化的通用范式
多数报道把Daybreak Blue/Red当作网络安全这个特殊领域的专属方案来报——因为网络安全天然就是"防守能力=攻击能力"这类高度双重用途场景。但把这周的两条线放在一起看,会发现一个容易被忽略的结构性事实:"用审核和权限分级来管理同一套底层能力的不同调用者",很可能不会停留在网络安全这一个领域,而正在变成整个AI产品化的通用范式——Liferay报告里"只有24%的公司有公司级AI使用政策"这个数字,本质上和"Daybreak需要分级准入"是同一类问题在不同风险量级下的呈现:
企业里的AI agent同样存在"可以做低权限的事(如整理文档、答复常见问题)"和"能做高权限的事(如自动审批、直接改动生产系统)"的能力光谱,只是多数企业目前既没有像OpenAI那样把这条光谱明确分级,也没有配套的身份、权限、监控机制去匹配不同风险等级的调用者——这正是"只有25%能衡量、只有24%有政策"这两个数字背后更深一层的解释:衡量不出来,恰恰是因为多数企业还没有先把"谁能让agent做什么"这件事分级想清楚。
置信度与局限
OpenAI是否正式认定Astra具备"Critical"级网络能力,官方表态是"无法排除"而非"已确认",这里如实保留这一措辞区别,不做过度推断。GPT-5.6-Cyber发现的两个V8漏洞中,只有一个获得公开CVE编号(CVE-2026-15903,CVSS 8.8,谷歌已修复),另一个未获独立公开编号,不应误读为一个CVE编号对应两个漏洞。Liferay调研样本为500名美国从业者,代表性有地域局限(未覆盖非美国市场企业);麦肯锡的88%/23%数字方向一致,但样本、时点、方法论均不同,不可直接相加或精确对比。"分级准入正在成为AI产品化通用范式"这一判断,目前只有网络安全(Daybreak)与企业agent采用(Liferay)两个场景的间接佐证,尚缺一个跨行业、跨场景的直接证据把二者严格关联起来——网络安全领域的"分级准入"有法律与国家安全层面的强制力做后盾(身份验证、法律承诺书具有可执行性),而企业内部的"agent权限分级"目前缺乏同等强度的外部约束,二者能否类比、企业侧是否会真正走向同等严格的分级机制,仍是一个待验证的推断,不应视为既定趋势。
参考文献
- Reuters/Axios/CNBC及OpenAI官方博客关于Astra暂停的报道,2026年8月7日前后
- OpenAI官方博客《Expanding Daybreak as the Cyber Defense Window Narrows》,2026年8月10日
- Liferay《2026敏捷AI采用与治理报告》(Pollfish执行),2026年8月12日
- 麦肯锡《State of AI in 2025》,2025年11月