OpenAI 新一代旗舰模型:
GPT-6 Astra,正式来了。
如果说过去的大模型主要是在比:
谁回答问题更聪明;
谁写代码更强;
谁推理 Benchmark 更高。
那 Astra 这次的定位明显变了。
OpenAI 给它的核心标签是:
面向最困难的端到端工作。
也就是说,不只是告诉你:
“这件事应该怎么做。”
而是希望模型能够自己:
理解任务;
寻找资料;
操作电脑;
调用工具;
修改文件;
运行软件;
验证结果;
最后真正把东西交付出来。
从这个角度看,GPT-6 Astra 更像是为:
Agent 时代
准备的一代旗舰模型。
一、Astra 重点已经不是“聊天”
GPT-6 Astra 这一代重点强化了六个方向:
计算机操作
网页浏览
软件工程
网络安全
科学研究
专业知识工作
尤其是 Computer Use。
它可以直接处理:
填写网页表单;
更新 CRM;
安排日历;
操作专业软件;
安装程序;
排查电脑问题;
运行测试;
修改网站。
以前模型更多是:
告诉你按钮在哪里。
Astra 的目标则是:
直接过去把按钮点了。
这也是 Chatbot 和 Agent 最大的区别之一。
二、OSWorld 2.0:72.6%
计算机操作是这次提升最明显的一块。
在 OSWorld 2.0 中:
GPT-6 Astra:72.6%
上一代 GPT-5.6 Sol:
65.7%。
而且不仅成功率提高,完成任务的时间也明显缩短。
OpenAI 的模拟测试显示:
Astra 平均约 40 分钟完成任务。
GPT-5.6 Sol 则需要约 75 分钟。
也就是说:
速度接近快了一倍。
模型不只是:
更会操作电脑。
而是:
更快把电脑上的事情做完。
三、软件工程继续大涨
Coding 依然是 Astra 的核心能力。
Terminal-Bench 4.0:
57.9%。
GPT-5.6 Sol:
37.3%。
Claude Fable 5.1:
55.8%。
另外 DeepSWE v1.1 达到:
74.1%。
这类 Benchmark 测试的已经不是:
写一个 Python 函数。
而是让 Agent 真的进入:
Terminal;
代码仓库;
系统环境
完成复杂任务。
所以 Astra 真正提升的是:
软件工程 Agent 能力。
比如:
理解项目;
修改代码;
安装依赖;
运行测试;
发现错误;
继续 Debug。
四、前端也开始自己“看效果”
Astra 还进一步提升了:
视觉判断。
例如做一个网站。
它不只是负责:
生成 React 和 CSS。
还可以继续:
打开页面;
观察实际渲染;
判断布局;
检查视觉;
运行前端测试;
再修改代码。
以后 Coding Agent 的工作方式会越来越像:
写代码
↓
运行
↓
看页面
↓
发现问题
↓
修改
↓
重新验证而不是:
写完代码以后就宣布任务完成。
这对 Vibe Coding 尤其重要。
五、文档、Excel、PPT 也被重点强化
GPT-6 Astra 这一代还有一个很明显的方向:
专业办公。
OpenAI 特别强化了:
Documents;
Spreadsheets;
Presentations。
比如给模型:
公司原来的 PPT 模板。
再说:
根据这些业务数据制作季度汇报。
Astra 会尽量继承原来的:
字体;
颜色;
页面结构;
写作语气;
视觉规范。
而不是每次重新创造一套:
“AI 风格 PPT”。
这对真正企业工作来说,比单纯:
“帮我写个大纲”
重要很多。
六、模型开始更懂“什么时候应该问你”
长程 Agent 有一个特别难的问题:
什么时候自己决定,什么时候应该问用户?
以前模型很容易出现两个极端。
一种是:
什么都问。
导致任务一直被打断。
另一种是:
什么都自己猜。
最后方向完全错了。
Astra 这次针对这个问题进行了强化。
普通细节:
模型可以结合上下文自己做合理判断。
真正会影响最终结果的重要缺失信息:
它会主动问更加具体的问题。
而在 Codex 中,它甚至可以:
一边继续完成不受影响的工作,一边异步等你回答。
不用因为一个问题把整个任务停下来。
七、任务做到一半,也可以直接改需求
这次 API 新增的一个能力特别适合 Agent:
Mid-turn Steering。
以前 Agent 已经开始执行以后:
突然发现需求写错。
可能只能:
取消任务;
重新开始。
Astra 现在支持:
任务执行过程中直接追加新指令。
比如 Agent 已经开始:
做一个网站。
做到一半你突然说:
不要 Vue 了,改成 React,同时保留已经完成的页面设计。
模型可以在当前任务基础上调整方向。
更关键的是:
它会尽量继续记住原本的:
目标;
限制;
上下文。
而不是把你这句话理解成:
一个全新的任务。
八、工具也可以异步调用
GPT-6 Astra API 还加入:
Async Tool Calling。
传统 Agent 很容易变成:
调用工具 A
↓
等结果
↓
模型继续
↓
调用工具 B如果工具 A 很慢:
整个 Agent 就在那里等。
现在 Astra 可以:
工具 A 在后台执行;
同时继续思考;
调用其他工具;
或者先处理不依赖 A 的工作。
等工具结果回来后:
再继续合并结果。
这对:
网页研究;
数据库查询;
代码任务;
复杂企业 Agent
都会明显提高效率。
九、推理强度可以做到一半再调整
Astra 支持五档 Reasoning Effort:
low
medium
high
xhigh
max
而且现在可以在同一个长任务里:
动态调整。
例如:
第一步整理文件:
low。
进入复杂数学分析:
max。
最后生成摘要:
重新降到 low。
模型不用每一次都保持最高推理强度。
这对控制:
成本;
速度;
任务质量
很有价值。
十、1.05M上下文 + 128K输出
GPT-6 Astra API 支持:
1,050,000 Token Context Window
最大输出:
128,000 Token。
也就是正式进入:
百万 Token 上下文旗舰模型。
长上下文测试中,在 512K—1M 范围的 MRCR v2 8-needle 测试上,Astra 达到:
96.3%。
这对于:
大型代码库;
几十份报告;
企业知识;
长期 Agent Session
都非常重要。
因为 Agent 越复杂,需要持续记住的东西就越多。
十一、数学和抽象推理已经开始接近“打满”
这次最夸张的几个 Benchmark 来自科研和推理。
FrontierMath Tier 4
97.6%。
官方发布文案四舍五入写成:
98%。
ARC-AGI-3
99.9%。
ExploitBench
100%。
另外:
GPQA Diamond:
96.0%。
Terminal-Bench Science 0.1:
64.6%。
OpenAI 还披露 Astra 已经参与一些真实数学研究,并帮助推进长期开放问题。
不过需要注意:
这些 Benchmark 中部分采用:
最高 Reasoning Effort;
工具;
特定 Harness;
研究环境。
所以它们更适合说明:
模型能力上限。
不意味着普通 ChatGPT 对话每次都会得到完全相同的表现。
十二、网络安全能力第一次达到“Critical”
GPT-6 Astra 还有一个非常特殊的标签:
它是 OpenAI 首个达到:
Critical Cybersecurity Capability
门槛的公开部署模型。
按照 OpenAI Preparedness Framework 的定义:
如果拥有正确工具和环境,Astra 已经可能:
发现此前未知的安全漏洞;
开发新的漏洞利用方法;
并对多个高防护系统执行更加复杂的任务。
这也是为什么 OpenAI 对 Astra 的网络安全能力明显更加谨慎。
普通公开版本更偏向:
安全代码审查;
修复漏洞;
防御分析。
更加高级的:
漏洞验证;
恶意软件分析;
Detection Engineering
会通过受控方式逐步开放。
十三、这次安全重点已经进入 Agent 行为
Agent 能操作电脑以后:
风险也完全不同。
一个普通 Chatbot 输出错误:
最多是一段文字错了。
一个 Computer Use Agent 判断错误:
可能真的会:
删除文件;
提交交易;
访问不该访问的数据;
执行危险命令。
所以 Astra 重点加强了:
任务边界识别;
Prompt Injection 防护;
越权行为监控;
Misalignment Monitoring。
OpenAI 甚至专门设计测试:
当任务无法正常完成时,模型会不会:
为了完成目标偷偷绕开限制。
相比 GPT-5.6 Sol,Astra 在这类行为上明显更加克制。
十四、API价格:10美元输入、50美元输出
GPT-6 Astra 标准 API 价格为:
输入:$10 / 1M Tokens
缓存输入:$1 / 1M Tokens
Cache Write:$12.50 / 1M Tokens
输出:$50 / 1M Tokens。
属于明显的:
旗舰高性能档。
另外还有 Fast Mode:
速度最高约为 Standard 的:
2 倍。
价格同样:
2 倍。
如果任务对时间特别敏感,可以换速度。
十五、超过272K输入以后,长上下文会更贵
这一点开发者需要特别注意。
虽然 Astra 支持 1.05M 上下文。
但如果单次输入超过:
272K Token
整个请求会进入长上下文价格。
输入和 Cache:
2 倍。
输出:
1.5 倍。
所以:
支持 1M ≠ 1M 和普通请求一个价格。
真正做大型 Repo 或长文档 Agent 时,需要把这个成本一起算进去。
十六、ChatGPT和API什么时候能用?
GPT-6 Astra 正在分阶段开放。
首批先进入:
有限组织和 Trusted Access Program。
随后几天会逐渐提供给:
ChatGPT Plus
Pro
Business
Enterprise。
开发者则可以通过:
OpenAI API
调用。
模型 ID:
gpt-6-astra
另外还会进入:
Microsoft Azure
以及:
Amazon Bedrock。
也就是说,这次 Astra 从一开始就是:
个人用户 + 开发者 + 企业云平台
一起推进。
结语
GPT-6 Astra 这次最值得记住的,其实不是:
ARC-AGI-3 99.9%。
也不是:
FrontierMath 97.6%。
而是 OpenAI 对旗舰模型的定位正在明显变化。
以前旗舰模型更像:
“最聪明的聊天机器人。”
现在 Astra 更像:
“可以被委托完整任务的数字执行者。”
它可以:
看电脑;
操作网页;
写代码;
运行软件;
制作 Excel;
生成 PPT;
做科研;
调用工具;
执行长任务。
甚至当你做到一半突然改变需求:
它还可以继续保持原来的上下文往下走。
这才是 GPT-6 Astra 真正值得看的地方。
大模型下一阶段可能越来越不只是:
回答问题。
而是:
从一句需求开始,一直做到最终交付。
评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。