OpenAI 新一代旗舰模型:

image.png

GPT-6 Astra,正式来了。

如果说过去的大模型主要是在比:

谁回答问题更聪明;

谁写代码更强;

谁推理 Benchmark 更高。

那 Astra 这次的定位明显变了。

OpenAI 给它的核心标签是:

面向最困难的端到端工作。

也就是说,不只是告诉你:

“这件事应该怎么做。”

而是希望模型能够自己:

理解任务;

寻找资料;

操作电脑;

调用工具;

修改文件;

运行软件;

验证结果;

最后真正把东西交付出来。

从这个角度看,GPT-6 Astra 更像是为:

Agent 时代

准备的一代旗舰模型。


一、Astra 重点已经不是“聊天”

GPT-6 Astra 这一代重点强化了六个方向:

计算机操作

网页浏览

软件工程

网络安全

科学研究

专业知识工作

尤其是 Computer Use。

它可以直接处理:

填写网页表单;

更新 CRM;

安排日历;

操作专业软件;

安装程序;

排查电脑问题;

运行测试;

修改网站。

以前模型更多是:

告诉你按钮在哪里。

Astra 的目标则是:

直接过去把按钮点了。

这也是 Chatbot 和 Agent 最大的区别之一。


二、OSWorld 2.0:72.6%

计算机操作是这次提升最明显的一块。

在 OSWorld 2.0 中:

GPT-6 Astra:72.6%

上一代 GPT-5.6 Sol:

65.7%。

而且不仅成功率提高,完成任务的时间也明显缩短。

OpenAI 的模拟测试显示:

Astra 平均约 40 分钟完成任务。

GPT-5.6 Sol 则需要约 75 分钟。

也就是说:

速度接近快了一倍。

模型不只是:

更会操作电脑。

而是:

更快把电脑上的事情做完。


三、软件工程继续大涨

Coding 依然是 Astra 的核心能力。

Terminal-Bench 4.0:

57.9%。

GPT-5.6 Sol:

37.3%。

Claude Fable 5.1:

55.8%。

另外 DeepSWE v1.1 达到:

74.1%。

这类 Benchmark 测试的已经不是:

写一个 Python 函数。

而是让 Agent 真的进入:

Terminal;

代码仓库;

系统环境

完成复杂任务。

所以 Astra 真正提升的是:

软件工程 Agent 能力。

比如:

理解项目;

修改代码;

安装依赖;

运行测试;

发现错误;

继续 Debug。


四、前端也开始自己“看效果”

Astra 还进一步提升了:

视觉判断。

例如做一个网站。

它不只是负责:

生成 React 和 CSS。

还可以继续:

打开页面;

观察实际渲染;

判断布局;

检查视觉;

运行前端测试;

再修改代码。

以后 Coding Agent 的工作方式会越来越像:

写代码
↓
运行
↓
看页面
↓
发现问题
↓
修改
↓
重新验证

而不是:

写完代码以后就宣布任务完成。

这对 Vibe Coding 尤其重要。


五、文档、Excel、PPT 也被重点强化

GPT-6 Astra 这一代还有一个很明显的方向:

专业办公。

OpenAI 特别强化了:

Documents;

Spreadsheets;

Presentations。

比如给模型:

公司原来的 PPT 模板。

再说:

根据这些业务数据制作季度汇报。

Astra 会尽量继承原来的:

字体;

颜色;

页面结构;

写作语气;

视觉规范。

而不是每次重新创造一套:

“AI 风格 PPT”。

这对真正企业工作来说,比单纯:

“帮我写个大纲”

重要很多。


六、模型开始更懂“什么时候应该问你”

长程 Agent 有一个特别难的问题:

什么时候自己决定,什么时候应该问用户?

以前模型很容易出现两个极端。

一种是:

什么都问。

导致任务一直被打断。

另一种是:

什么都自己猜。

最后方向完全错了。

Astra 这次针对这个问题进行了强化。

普通细节:

模型可以结合上下文自己做合理判断。

真正会影响最终结果的重要缺失信息:

它会主动问更加具体的问题。

而在 Codex 中,它甚至可以:

一边继续完成不受影响的工作,一边异步等你回答。

不用因为一个问题把整个任务停下来。


七、任务做到一半,也可以直接改需求

这次 API 新增的一个能力特别适合 Agent:

Mid-turn Steering。

以前 Agent 已经开始执行以后:

突然发现需求写错。

可能只能:

取消任务;

重新开始。

Astra 现在支持:

任务执行过程中直接追加新指令。

比如 Agent 已经开始:

做一个网站。

做到一半你突然说:

不要 Vue 了,改成 React,同时保留已经完成的页面设计。

模型可以在当前任务基础上调整方向。

更关键的是:

它会尽量继续记住原本的:

目标;

限制;

上下文。

而不是把你这句话理解成:

一个全新的任务。


八、工具也可以异步调用

GPT-6 Astra API 还加入:

Async Tool Calling。

传统 Agent 很容易变成:

调用工具 A
↓
等结果
↓
模型继续
↓
调用工具 B

如果工具 A 很慢:

整个 Agent 就在那里等。

现在 Astra 可以:

工具 A 在后台执行;

同时继续思考;

调用其他工具;

或者先处理不依赖 A 的工作。

等工具结果回来后:

再继续合并结果。

这对:

网页研究;

数据库查询;

代码任务;

复杂企业 Agent

都会明显提高效率。


九、推理强度可以做到一半再调整

Astra 支持五档 Reasoning Effort:

low

medium

high

xhigh

max

而且现在可以在同一个长任务里:

动态调整。

例如:

第一步整理文件:

low。

进入复杂数学分析:

max。

最后生成摘要:

重新降到 low。

模型不用每一次都保持最高推理强度。

这对控制:

成本;

速度;

任务质量

很有价值。


十、1.05M上下文 + 128K输出

GPT-6 Astra API 支持:

1,050,000 Token Context Window

最大输出:

128,000 Token。

也就是正式进入:

百万 Token 上下文旗舰模型。

长上下文测试中,在 512K—1M 范围的 MRCR v2 8-needle 测试上,Astra 达到:

96.3%。

这对于:

大型代码库;

几十份报告;

企业知识;

长期 Agent Session

都非常重要。

因为 Agent 越复杂,需要持续记住的东西就越多。


十一、数学和抽象推理已经开始接近“打满”

这次最夸张的几个 Benchmark 来自科研和推理。

FrontierMath Tier 4

97.6%。

官方发布文案四舍五入写成:

98%。

ARC-AGI-3

99.9%。

ExploitBench

100%。

另外:

GPQA Diamond:

96.0%。

Terminal-Bench Science 0.1:

64.6%。

OpenAI 还披露 Astra 已经参与一些真实数学研究,并帮助推进长期开放问题。

不过需要注意:

这些 Benchmark 中部分采用:

最高 Reasoning Effort;

工具;

特定 Harness;

研究环境。

所以它们更适合说明:

模型能力上限。

不意味着普通 ChatGPT 对话每次都会得到完全相同的表现。


十二、网络安全能力第一次达到“Critical”

GPT-6 Astra 还有一个非常特殊的标签:

它是 OpenAI 首个达到:

Critical Cybersecurity Capability

门槛的公开部署模型。

按照 OpenAI Preparedness Framework 的定义:

如果拥有正确工具和环境,Astra 已经可能:

发现此前未知的安全漏洞;

开发新的漏洞利用方法;

并对多个高防护系统执行更加复杂的任务。

这也是为什么 OpenAI 对 Astra 的网络安全能力明显更加谨慎。

普通公开版本更偏向:

安全代码审查;

修复漏洞;

防御分析。

更加高级的:

漏洞验证;

恶意软件分析;

Detection Engineering

会通过受控方式逐步开放。


十三、这次安全重点已经进入 Agent 行为

Agent 能操作电脑以后:

风险也完全不同。

一个普通 Chatbot 输出错误:

最多是一段文字错了。

一个 Computer Use Agent 判断错误:

可能真的会:

删除文件;

提交交易;

访问不该访问的数据;

执行危险命令。

所以 Astra 重点加强了:

任务边界识别;

Prompt Injection 防护;

越权行为监控;

Misalignment Monitoring。

OpenAI 甚至专门设计测试:

当任务无法正常完成时,模型会不会:

为了完成目标偷偷绕开限制。

相比 GPT-5.6 Sol,Astra 在这类行为上明显更加克制。


十四、API价格:10美元输入、50美元输出

GPT-6 Astra 标准 API 价格为:

输入:$10 / 1M Tokens

缓存输入:$1 / 1M Tokens

Cache Write:$12.50 / 1M Tokens

输出:$50 / 1M Tokens。

属于明显的:

旗舰高性能档。

另外还有 Fast Mode:

速度最高约为 Standard 的:

2 倍。

价格同样:

2 倍。

如果任务对时间特别敏感,可以换速度。


十五、超过272K输入以后,长上下文会更贵

这一点开发者需要特别注意。

虽然 Astra 支持 1.05M 上下文。

但如果单次输入超过:

272K Token

整个请求会进入长上下文价格。

输入和 Cache:

2 倍。

输出:

1.5 倍。

所以:

支持 1M ≠ 1M 和普通请求一个价格。

真正做大型 Repo 或长文档 Agent 时,需要把这个成本一起算进去。


十六、ChatGPT和API什么时候能用?

GPT-6 Astra 正在分阶段开放。

首批先进入:

有限组织和 Trusted Access Program。

随后几天会逐渐提供给:

ChatGPT Plus

Pro

Business

Enterprise。

开发者则可以通过:

OpenAI API

调用。

模型 ID:

gpt-6-astra

另外还会进入:

Microsoft Azure

以及:

Amazon Bedrock。

也就是说,这次 Astra 从一开始就是:

个人用户 + 开发者 + 企业云平台

一起推进。


结语

GPT-6 Astra 这次最值得记住的,其实不是:

ARC-AGI-3 99.9%。

也不是:

FrontierMath 97.6%。

而是 OpenAI 对旗舰模型的定位正在明显变化。

以前旗舰模型更像:

“最聪明的聊天机器人。”

现在 Astra 更像:

“可以被委托完整任务的数字执行者。”

它可以:

看电脑;

操作网页;

写代码;

运行软件;

制作 Excel;

生成 PPT;

做科研;

调用工具;

执行长任务。

甚至当你做到一半突然改变需求:

它还可以继续保持原来的上下文往下走。

这才是 GPT-6 Astra 真正值得看的地方。

大模型下一阶段可能越来越不只是:

回答问题。

而是:

从一句需求开始,一直做到最终交付。


相关链接

GPT-6 Astra 官方发布页面

https://openai.com/index/gpt-6-astra/