OpenAI GPT-6 Astra 官方发布图。来源:。
GPT-6 Astra API 已于 2026 年 9 月 3 日发布,稳定模型 ID 是 gpt-6-astra。它提供 1,050,000 token 上下文窗口,最大输入 922,000 token,最大输出 128,000 token,支持文本和图片输入,也能使用函数调用、网页搜索、计算机使用、代码解释器和 MCP 等工具。
这次更新的重点不是又一个旗舰编号。OpenAI 把 GPT-6 Astra 定位为面向计算机使用、浏览、软件工程、科学和专业工作的最强模型,并称它在多项评测上用更少输出 token 完成更难的任务。结果是单价明显高于 GPT-5.6 Sol,但官方给出的“单任务估计成本”并不总是更高。采购时要把列表价和任务账单分开看。
ChatGPT 侧的变化同样具体。官方对比图显示,Astra 在职业网站、大学筛选和购物清单这类任务里,会先问一个能改变结果的问题;GPT-5.6 Sol 更常直接给出答案。这不是宣传口号,而是接入时需要处理的产品行为。
下面把模型规格、官方 benchmark、UI 演示、调用方式和迁移风险分开说明。
GPT-6 Astra API 关键信息
| 项目 | 官方信息 | 对接时要注意什么 |
|---|---|---|
| 发布时间 | 2026 年 9 月 3 日 | 本文核验于 2026 年 9 月 6 日 |
| 稳定模型 ID | gpt-6-astra | 当前文档只列出这一个 snapshot |
| 上下文窗口 | 1,050,000 token | 长上下文不等于要把全部资料塞进一次请求 |
| 最大输入 | 922,000 token | 超过 272K 输入会触发更高单价 |
| 最大输出 | 128,000 token | Agent 仍需限制轮数、超时和总输出预算 |
| 知识截止 | 2026 年 4 月 30 日 | 更新年份事实仍需检索或联网工具 |
| 输入类型 | 文本、图片 | 输出仅为文本;图片生成要走独立工具 |
| Reasoning | low、medium、high、xhigh、max | 不支持 none;欧盟数据驻留也不可用 Fast mode |
| 主要工具 | 网页搜索、文件搜索、计算机使用、代码解释器、MCP、Skills、hosted shell | 工具调用应使用 Responses API |
| API | OpenAI API、Azure、Bedrock | Chat Completions 可发文本,工具调用需要 Responses |
模型规格以 OpenAI 的 为准。它可以读取图片,但返回的是文本。如果工作流需要出图,仍要连接图像生成工具,而不是指望模型直接画图。
1M 上下文适合大型代码库、长会话和文档包。生产系统仍应保留检索、缓存和上下文裁剪,因为输入越长,延迟与账单越容易上升。超过 272K 输入后,整次请求按更高费率计费,这一点比“支持 1M”更影响真实成本。
GPT-6 Astra 会先出现在哪里?
这次发布覆盖 ChatGPT、API 和云平台,但开放节奏并不完全同步。
ChatGPT 先向有限组织开放,随后几天内进入 Plus、Pro、Business 和 Enterprise。Astra 占用现有订阅额度,额外用量可买积分。Pro、Business 和 Enterprise 还会提供 GPT-6 Astra Pro。Enterprise 管理员需要手动开启,默认关闭。
OpenAI API 使用模型名 gpt-6-astra。官方推荐新项目走 。Chat Completions 仍可用于文本生成,但工具调用必须改用 Responses。
Codex 随 Astra 更新了 harness。发布页称,结合模型效率后,Mind2Web 上的任务完成速度约为当前 GPT-5.6 Sol 体验的 1.9 倍。Codex 还增加了跨上下文窗口保存和检索笔记的实验能力,避免长调试会话每次压缩都丢掉失败原因。
Azure 和 AWS Bedrock 会提供同一模型。企业如果已经把流量放在云厂商侧,应核对本区域的驻留、ZDR 和 Fast mode 限制,而不是只看 OpenAI 主站价格。
因此,普通产品接入应以 gpt-6-astra 和 Responses API 为准。ChatGPT 里的 Astra Pro、Codex 实验功能和云厂商区域限制,都要单独确认。
GPT-6 Astra API 价格
OpenAI 公布的是 Standard 列表价,单位都是每百万 token。缓存写入按未缓存输入价的 1.25 倍计费。
| 计费项目 | 短上下文 | 输入超过 272K 后 |
|---|---|---|
| 未缓存输入 | 10.00 美元 | 20.00 美元 |
| 缓存输入 | 1.00 美元 | 2.00 美元 |
| 缓存写入 | 12.50 美元 | 25.00 美元 |
| 输出 | 50.00 美元 | 75.00 美元 |
Batch 和 Flex 是 Standard 的 50%。Fast mode 是适用费率的 2 倍,官方没有给延迟 SLA;欧盟数据驻留不可使用 Fast 或 Priority。区域处理端点另有 10% 上浮。
例如,一次短上下文任务使用 100 万未缓存输入 token,并生成 20 万输出 token。模型费用约为 20 美元:输入 10 美元,输出 10 美元。如果同一请求命中缓存输入,输入部分可降到 1 美元,但首次写入缓存仍按 12.50 美元计。这个例子没有加入搜索、计算机使用等按次工具费。
对比 GPT-5.6 Sol 的 4 / 20 美元单价,Astra 的列表价更贵。OpenAI 的论点是:在若干评测配置下,Astra 用更少输出 token 完成任务,估计 API 成本反而更低。这只能当作待验证的账单假设。上线前应按任务成功率和完整费用一起测,不要只看每百万 token 的标价。
完整档位见 。ChatGPT 订阅额度、Codex 积分和 API 账单不是同一套计数。
GPT-6 Astra Benchmark 应该怎么看?
OpenAI 的发布表把 GPT-6 Astra 与 GPT-5.6 Sol、Claude Fable 5.1、Claude Opus 5、Gemini 3.8 Flash 放在同一组计算机使用、编程、科学和安全评测中。数字是官方在指定 harness、effort 和工具设置下给出的最高分,不是 Mengbi 复测。
计算机使用和专业工作里,差距比较明显。Agents' Last Exam 上 Astra 为 59.3%,Opus 5 为 55.5%,Sol 为 53.6%;官方称这一配置下 Astra 的输出 token 比 Opus 5 少约 65%。OSWorld 2.0 离线集上,Astra 得到 72.6%,大约 40 分钟完成一项任务;Sol 是 65.7%,大约 75 分钟。BenchCAD 几何重合分为 95.9%,Sol 为 83.3%,Fable 5.1 为 84.3%。
编程评测没有出现一边倒。Terminal-Bench 4.0 上 Astra 为 57.9%,Sol 为 37.3%,Fable 5.1 为 55.8%。DeepSWE v1.1 上 Astra 为 74.1%,Sol 为 72.7%,Gemini 3.8 Flash 为 73.8%,Opus 5 为 73.7%。这里更适合判断 Astra 进入了同一梯队,而不是宣布它在所有仓库任务上领先。
科学和抽象推理是发布页着墨最多的部分。Terminal-Bench Science 0.1 上 Astra 为 64.6%,Fable 5.1 为 52.6%,Sol 为 22.4%。GPQA Diamond 为 96.0%。FrontierMath Tier 4 为 97.6%,发布文也写成约 98%。ARC-AGI-3 为 99.9%,脚注说明使用了 Responses API harness 的两项设置调整。OpenAI 还称 Astra 帮助把无限多对素数的间隔上界从 240 推进到 186,并改进了一项保持八十多年的大素数间隔界;证明材料放在官网 PDF 中,这属于研究声明,不能直接换成产品 SLA。
网络安全需要单独阅读。OpenAI 说 Astra 达到其 Preparedness Framework 的 Critical 阈值。在研究环境下、关闭生产防护时,ExploitBench 为 100%,Sol 为 78.5%;ExploitGym 为 42.4%。当前上线版本会拒绝更高级的进攻性任务,例如为漏洞编写概念验证利用。防御向的代码审查和补丁工作可以使用;更宽松的防护会通过 OpenAI Daybreak 逐步放开。
这些成绩适合用来筛选测试对象。发布表混用了不同工具、提示、时间预算和“无生产防护”的研究配置,不能替代你们自己的任务集。对团队更有用的做法,是固定 30 到 100 个真实任务,记录最终验收是否通过、人工修正次数、工具调用轮数、总输入输出 token、超时和完整成本。
OpenAI 展示的 GPT-6 Astra UI
OpenAI 的发布文章放出了 ChatGPT 对比界面,以及电路、建筑、游戏和 CAD 演示。它们能说明 Astra 会在什么时候停下来提问,以及计算机使用能进入哪些专业软件,但仍是官方挑选的展示片段。
职业网站:先问去向,再生成站点
同一句“用我的 LinkedIn 做个人网站”。Sol 直接发布作品集,Astra 先问要转去什么岗位。截图来自 。
两边都接到转行做个人网站的请求。Sol 用了 13 分 15 秒,给出一个已发布的作品集;Astra 在 20 秒时停下来,问对方要转入什么职业。官方想证明的是判断力:缺了去向,站点叙事会变。接入 ChatGPT 或 Agent 产品时,要把这种提问当成默认行为,用提示词决定它该先做完可回看的草稿,还是必须等用户回答。
大学筛选:预算是硬上限还是含奖学金
同一条加州高中生的申请咨询。Sol 给出学校表,Astra 把 8 万美元预算拆成两种解释。截图来自 OpenAI 官方发布文章。
Sol 很快列出 Stony Brook、Pitt 等选项。Astra 问:8 万美元是奖助学金前的硬上限,还是可以把更高学费、但奖助后可负担的学校算进去。这个问题会改变名单。如果你们的产品不能在中途向用户发问,就需要在系统提示里写明默认假设,否则任务会停在“Question”卡片上。
购物清单:人数、过敏和预算
同一句“帮我列下周购物清单,想省钱,不想每天做饭”。Sol 已列出食材,Astra 还在问家庭规模。截图来自 OpenAI 官方发布文章。
这张图把同一行为放到日常任务里。Sol 12 秒后给出一份两人份、做两次饭的清单;Astra 在相同时间询问人数、过敏和每周预算。对 C 端助手,这可能更稳;对批量 API,这会变成未完成的工具循环。官方迁移指南也写了:如果模型频繁请求批准,要用 initiative 提示把它推回“先做可回看的结果”。
KiCad:原理图到可制造 PCB
发布页称这是 15 秒浓缩回放,Astra 在 KiCad 中完成元件放置和走线。截取自 OpenAI 官方演示视频。
OpenAI 把这段演示当作计算机使用的代表:把电子原理图变成可制造的 PCB。画面里能看到布线、过孔、焊盘和板级三维视图。它说明模型可以进入专业桌面软件,不说明任意原理图都能一次布通,也不说明结果已经过 DRC 或工厂核对。
Blender 住宅与游戏城市
发布页配套的 Solace / Garden House 分镜首图,标注为 2026 年 9 月的相机对照。来源:OpenAI 官方发布素材。
发布页用来说明 Astra 能生成可玩场景和运动,而不是只有静态概念图。来源:OpenAI 官方发布素材。
这两张图对应发布页里的专业工作和视觉产出:Astra 在 Blender 中建住宅,再把场景送进 Unreal Engine 5;另一条演示则是城市游戏场景。它们适合判断“模型能否产出可继续编辑的资产”,不适合判断一次生成就能过设计评审。ChatGPT 的 Sites 功能也被写进同一段:可以用提示创建、托管和分享网站或小游戏。
FreeCAD:变速箱装配
窗口标题为 Transmission_5Speed_GearMotion,界面是真实的 FreeCAD 桌面软件。来源:OpenAI 官方发布文章。
FreeCAD 截图把计算机使用从浏览器表单推进到 CAD。模型、任务面板、三维视图和底部 Python 控制台都在。它适合作为“能否在专业 GUI 里继续干活”的示例,验收时仍要看尺寸、装配约束和导出文件能不能被工程师打开。
GPT-6 Astra API 怎么调用?
先在 创建密钥,保存到服务端环境变量 OPENAI_API_KEY。官方 Python 示例使用 Responses API。下面的基础请求没有加入工具,便于先确认鉴权、模型 ID 和返回格式。
OpenAI() 会读取 OPENAI_API_KEY。不要把 Key 放进浏览器 bundle、公开仓库或前端环境变量。服务端还需要记录请求 ID、token 用量、工具调用次数、延迟和停止原因,并为重试和 Agent 总轮数设上限。
需要提高推理强度时,使用 reasoning.effort。Astra 不接受 none;从旧模型的 none 或 minimal 迁过来时,官方建议先从 low 开始对比。
Chat Completions 仍然可用,但官方写明:GPT-6 Astra 的工具调用需要 Responses。已有函数调用、计算机使用或 MCP 的项目,不要只改模型名。异步工具调用、中途转向和 configuration_update 也建立在 Responses 上。完整说明见 和 。
单次文本请求成功,不代表长流程已经具备超时、幂等、工具权限和成本保护。计算机使用、搜索和代码解释器都可能按次计费,要在客户端处理工具结果、待完成的 call_id 和失败重试。
从 GPT-5.6 Sol 迁移到 GPT-6 Astra
如果现有请求只传 model 和一段文本,迁移可以先从替换模型 ID 开始。带采样、工具回合、缓存或 Fast mode 的请求,需要按 逐项清理。
| 现有设置 | GPT-6 Astra 的处理方式 |
|---|---|
gpt-5.6-sol 或其他 5.x 模型 | 改为 gpt-6-astra,保留旧模型作为回滚组 |
reasoning.effort: none 或 minimal | 改为 low 后对比效果;Astra 不支持 none |
| Chat Completions 工具调用 | 迁到 Responses API |
temperature、top_p、top_logprobs | 从请求中移除 |
| 欧盟数据驻留的 Fast / Priority | 改回 Standard |
| 请求之间改 effort | 用 configuration_update,保持请求级 effort 不变以保留缓存前缀 |
GPT-5.5 及更早的 prompt_cache_retention | 改为 prompt_cache_options.ttl,例如 "30m" |
| 模型频繁请求确认 | 补 initiative 提示,让它先完成可回看的结果 |
迁移时不要先把所有流量切过去。建议从 5% 到 10% 的影子请求或灰度流量开始,记录同一任务在 Sol 与 Astra 上的完成率、输出长度、提问次数、工具错误和账单。确认回滚开关、超时和日志字段都可用后,再扩大比例。
还有一个容易误判的变化:Astra 更愿意在关键分叉处提问。ChatGPT 里这表现为 Question 卡片;API 里则可能变成等待输入的未完成回合。看起来更谨慎,不代表任务更快结束。应比较完成一个业务结果的总成本和总时长,而不是只看首 token。
GPT-6 Astra 和 GPT-5.6 Sol 怎么选?
| 场景 | 先试 GPT-6 Astra | 暂时保留 GPT-5.6 Sol |
|---|---|---|
| 长流程编程和计算机使用 | 需要更高完成率和更少无效探索 | 现有流程已稳定,变更风险高 |
| 文档、幻灯片和专业软件操作 | 需要模板遵循和 GUI 操作 | 任务短、输出结构简单 |
| 成本敏感批处理 | 愿意测总 token,不只看单价 | Sol 已用较少费用完成任务 |
| 低延迟交互 | 可以测 Fast mode 或 low effort | 当前 P95 已达标,且必须留在欧盟驻留 |
| 网络安全防御 | 需要更强的代码审查和补丁辅助 | 不能接受更严格的拒答或误中断 |
| 生产迁移 | 有灰度、回滚和逐任务评测 | 还没有可靠的验收集与用量监控 |
Sol 仍然是价格更低的旗舰档。Astra 更适合已经证明任务难度配得上 10 / 50 美元单价、并且能处理提问、拒答和安全中断的工作流。如果你正在选择承载模型的 IDE 或终端 Agent,可以先看 Mengbi 的 。如果任务横跨研究、表格和日常协作, 更接近这次 ChatGPT 与 Codex 的产品形态。关于 Anthropic 同期旗舰,可对照 。
上线前如何测试 GPT-6 Astra?
一套可复用的验收表,至少应记录以下字段:
- 任务是否完成,以及最终测试是否通过。
- 模型提问、等待确认和人工补充提示的次数。
- 输入、缓存输入、缓存写入、输出 token 与完整费用。
- 工具调用总数、失败次数、异步未完成调用和重复调用次数。
- 首 token、完整响应和整项任务的 P50、P95 延迟。
- 超时、限流、空响应和结构化输出解析失败。
- 安全拒答、误中断、事实错误和带来源回答的可核验性。
测试集不要只放最顺利的案例。加入模糊需求、缺失预算、失效链接、超大文件、工具报错、重复函数结果和需要中途改需求的任务。每个任务保留固定输入、验收脚本与人工评分规则,才能比较模型版本,而不是比较两次不同的提示词。
OpenAI 的系统卡和安全更新也列出了监控盲区:Astra 的书面推理更难监控,复杂任务仍可能露出关键步骤,但简单任务的可监控性下降。涉及医疗、法律、金融、权限操作或网络安全的任务,仍需人工复核和系统级权限控制。API 里的错位监控可能直接停掉任务;ChatGPT 和 Codex 则可能要求用户确认后继续。
常见问题
GPT-6 Astra 什么时候发布?
OpenAI 在 2026 年 9 月 3 日发布 GPT-6 Astra。开发者可以通过 OpenAI API、Azure 和 AWS Bedrock 使用模型 ID gpt-6-astra。ChatGPT Plus、Pro、Business 和 Enterprise 会在随后几天内陆续开放。
GPT-6 Astra API 多少钱?
Standard 短上下文价格是输入每百万 token 10 美元、缓存输入 1 美元、缓存写入 12.50 美元、输出 50 美元。输入超过 272K token 后,输入和缓存按 2 倍、输出按 1.5 倍计费。Batch 和 Flex 为半价,Fast mode 为 2 倍价。
GPT-6 Astra 支持多长上下文?
上下文窗口为 1,050,000 token,最大输入 922,000 token,最大输出 128,000 token。长上下文会增加延迟和费用;超过 272K 输入还会提高整次请求单价。
GPT-6 Astra 能看图片吗?
可以读取图片,输出为文本。它适合理解截图、图表和文档页,但不直接生成图片。需要出图时要使用图像生成工具。
GPT-6 Astra 必须用 Responses API 吗?
文本生成仍可用 Chat Completions。函数调用、计算机使用、MCP 和官方新能力需要 Responses。新项目应按 Responses 接入。
GPT-6 Astra 支持 Fast mode 吗?
支持,但没有延迟 SLA,价格是适用费率的 2 倍。欧盟数据驻留不可使用 Fast 或 Priority,应使用 Standard。
是否应该立即从 GPT-5.6 Sol 升级?
不必立即全量切换。Astra 更适合进入计算机使用、长流程编程和专业产出的测试组;Sol 更便宜,也仍适合短任务和成本敏感流量。先灰度比较任务成功率、提问次数、延迟和完整账单。
来源与核验说明
本文的模型规格、价格、迁移项和评测数字来自 OpenAI 官方资料:
官方 UI 图片和演示帧来自 OpenAI 发布文章及所附视频,本文只截取用于评论与说明的画面,并保留来源。Benchmark 为 OpenAI 或其列出的评测方结果,Mengbi 没有使用付费 API Key 复测,也未接受 OpenAI 赞助。价格、模型状态、安全防护和预览功能可能变化,采购或生产接入前请复核官方页面。
最后核验:2026 年 9 月 6 日。

