GPT-6 Astra:网络安全 Critical 改的是门口,不是分数
9 月 3 日的系统卡承认 Astra 能在少人指导下发现并构造未知利用,于是高阶攻击请求默认不答,内部部署也要隔离。
9 月 3 日,Deployment Safety Hub 挂出 GPT-6 Astra 的系统卡,页上写着 Published September 3, 2026。我先去找表,没找到往常那种表。被推到前面的是 Preparedness Framework 里的一档:网络安全 Critical。
OpenAI 写得很具体。Astra 能在较少人工指导下,发现并构造未知漏洞利用。所以高阶攻击类请求默认拒绝,网络滥用和内部部署隔离一起收紧。
TL;DR:Critical 在这里不是形容词。它把「少人指导地构造未知利用」写成发布条件:普通接口默认不接这类请求,内部怎么部署也要单独隔开。
三件事叠上,才够叫门槛
找已知漏洞,经常是检索加套用。构造未知利用,是把还没写进公告的观察变成能跑的步骤。「较少人工指导」再把专家从环里抽走。三句拆开,每一句都能出现在任何安全博客里。叠在一起,默认拒绝才说得通:公司认为这条能力已经不适合当普通功能卖。
拒绝的是请求类型。问概念可以,问「把还没公开的洞做成能跑的东西」在默认状态里不行。系统卡没写这条线画在哪句提示词上。线画歪了,后面会吵很久。线必须存在,这张卡已经认了。
多对一道题,改不了今晚能不能把接口交给一段无人值守的脚本。分数动的是排名,Critical 动的是门口。
只挡外部用户,挡不住
广部署之后,风险峰值通常不在演示厅。提示会被改着绕,输出会被拿去蒸馏,模型会被嵌进别人的工具链,对外只剩一句「我调了个 API」。隔离如果只写给外部用户,内部员工、自动评测、下游代理就是第二条出口。
系统卡把内部部署隔离和网络滥用放在一起,是承认 Critical 也约束自家工具链。外面看不到拓扑,不必假装知道隔得有多深。可以坚持的最低一条是:安全声明若不管内部怎么跑,它还是公告。
榜单欢迎大家一起变强。一旦「强」里包含「能自己把未知漏洞做成利用」,默认就很难再是全量开放。收窄请求,收窄谁能碰到模型,或者收窄模型能碰到的网络,至少得占一条。Astra 公开占了第一条,并写到了第三条的内部侧。
开关按最坏的那类用途设
多数调用很普通:解释一段报错,改一个函数,把日志缩成摘要。开关仍然不能按平均用户来定。同一接口里只要有一类用途,能把「发现未知漏洞」推进到「构造可执行的利用」,旁边几乎不用人看着,默认就得按这类用途写。日常那点便利,不然就会变成这条通道。
「默认拒绝」因此不能读成能力不存在。拒绝是策略。写进 Critical,意思是这条能力被认为已经在模型里,只是不该顺着普通 API 流出去。策略会旧:提示被拆开重试,下游代理把一个被拒绝的大问题切成许多看着无害的小问题。那是策略还能活多久,不是 9 月 3 日那句话的反证。
Preparedness Framework 不是条约,Critical 也不是监管盖章。当天外面能核对的,是发布日期、这个标签,以及「少人指导」「未知漏洞利用」「默认拒绝」「内部隔离」这几组写出来的词。分类器漏不漏、隔离到哪一层工程边界、「未知」离真实零日有多远,卡上没有。没写出来的强度,别转述成已经证实的强度。
我在意的是顺序。附录的写法是产品照常全量,限制事后再补。这张卡把能力陈述里最重的一级,直接对着访问的默认值。别的科目还可以继续比谁聪明。比到「能把漏洞做成利用」,只比被允许的题目上各得多少分,已经漏掉了门口。