OpenAI 在北京时间 9 月 4 日凌晨3点33,甩出了新的王炸,正式发布新一代旗舰模型 GPT-6 Astra。

OpenAI 的总裁 Greg Brockman 更是用了那句著名的开场白向世界致意:“欢迎来到 AGI 时代。”

而就在今天,GPT-6 Astra 已经全量上线,我的 ChatGPT 已经蹬起来了,等出结果了再给大家汇报。

为了让大家一睹为快,我把 OpenAI 刚发布的官方技术报告、安全评估文档,以及早期开发者的实测反馈全部过了一遍,可以自信地、大方地、光明磊落地帮你搞清楚这三件事。
- 第一,为什么官方敢宣布 AGI 时代来了?ARC-AGI-3 拿下 99.9% 到底意味着什么?
- 第二,为什么它能直接操作电脑,还把安全等级干到了史无前例的 Critical?
- 第三,面对这种真正能自己干活的模型,我们程序员的工作流该怎么调整?

哈喽大家好,我是二哥呀。今天用 3 分钟,给你讲清楚刚刚发布的 GPT-6 Astra 到底带来了什么。
系好安全带,我们粗粗粗出发了~
先说第一件事,官方为什么敢宣布 AGI 时代来了。
核心依据就是这次在 ARC-AGI-3 评测里拿下的 99.9% 准满分。
可能有小伙伴对这个榜单不太熟悉。以前的大模型跑分,考的大多是题库和死记硬背。但 ARC 测的是真正的流体智力,里面的题目全是模型在训练数据里从来没见过的全新抽象图形规律,之前的顶尖大模型在这个榜单上甚至连 1% 都拿不到。
这次 GPT-6 Astra 能拿到 99.9%,靠的是底层引入的紧凑符号世界模型。它不再只是根据上文猜下一个词,而是在脑子里构建环境状态,做多步因果推演。

这种世界模型推演能力落到具体场景,就是这次最抢眼的 Agentic Computer Use,也就是直接操控电脑和浏览器。在权威的 OSWorld 2.0 评测里,它拿下了 72.6% 的高分,完成复杂跨软件任务的速度比上一代 GPT-5.6 快了整整 47%,而且全程盯紧原始目标,完全不会半路跑偏。
那聪明的你肯定想到了,既然它推理这么强,还能操作软件,安全防线扛得住吗?
这次 OpenAI 披露了一个非常震撼的事实。GPT-6 Astra 是他们历史上第一个在网络安全维度达到 Critical,也就是严重高危级别的商用模型。
在 ExploitBench 漏洞测试中,它的得分直接打满了 100%。它不仅能看懂代码,还能自主分析未公开的安全缺陷,甚至推导攻击路径。所以 OpenAI 启动了最高等级的安全框架,普通用户拿到的版本做了非常严格的安全对齐,而最底层的漏洞分析权限被严格锁在 Daybreak 计划里,只向特定企业和安全机构开放。

那聪明的你肯定又要问了,这跟我们日常写代码、做开发到底有什么关系?
关系太大了。官方在技术报告里写得很严谨,ARC-AGI-3 拿到 99.9% 的成绩,前提是搭配了有状态的 Harness。
这再次印证了我一直强调的核心公式,Agent 等于 Model 加上 Harness。
Model 这一侧,GPT-6 Astra 已经帮你升级到位了,世界模型推演、自主操作系统,底座能力直接拉满。但你光有一个聪明绝顶的大脑,不给它手和脚,它也干不了活。
Harness 就是那双手和脚。它包括你给模型开放了哪些工具,文件系统能不能读写,终端能不能执行命令,浏览器能不能操作,权限边界在哪里,哪些动作可以自主执行,哪些必须停下来等你确认,还有你写的 Prompt 告诉它目标是什么、约束是什么。这些全都是 Harness 的活。
所以无论你用 Claude Code、Codex,模型越强,Harness 的设计就越关键。以前模型的智能涌现的还不够,Harness 写得再好也体现不出来。现在模型够聪明了,谁能给它搭出更干净的工具接口、更合理的权限体系、更准确的任务描述,谁的 Agent 就跑得效果更好。
最后简单总结下。
GPT-6 Astra 凭借在 ARC-AGI-3 上的突破,标志着大模型从死记硬背的语言预测器,真正进化到了具备环境推演与自主执行能力的 AGI 雏形。更快的系统操作,加上底层的世界模型,让它在复杂任务里游刃有余。
这个知识点你学废了吗?想解锁更多 AI 硬核知识,点赞关注,我是二哥,咱们下期见!



