xAI Grok 4.7 官方发布图。来源:。
Grok 4.7 API 已于 2026 年 9 月 21 日发布,稳定模型 ID 是 grok-4.7。官方文档给出 500,000 token 上下文窗口,支持文本和图片输入、文本输出,也可配置推理强度,并使用函数调用、网页搜索、X 搜索和代码执行。
这次更新的重点不是又一个更大的窗口数字。Grok 4.7 沿用 Grok 4.6 的每百万 token 2 美元 / 6 美元列表价。xAI 称它能在困难任务上工作更久、更认真地检查自己的结果,并处在 CursorBench 4.0 的性价比前沿。采购时要把列表价和评测声明分开看:公布费率是官方价格;评测领先是指定设置下的厂商结果。
另一个容易传错的点是上下文长度。更早的 Grok 4.20 和 Grok 4.1 Fast 页面仍会出现 200 万 token 窗口。Grok 4.7 不是这个规格。当前模型页和价格表都写的是 500k token,提示达到 200k 后还会改用更高费率。
下面把模型规格、xAI 公布的评测、Artificial Analysis 独立分数和迁移风险分开说明。Mengbi 没有为本文跑付费 Grok 4.7 API 测试。
Grok 4.7 API 关键信息
| 项目 | 官方信息 | 对接时要注意什么 |
|---|---|---|
| 发布时间 | 2026 年 9 月 21 日 | 本文核验于 2026 年 9 月 22 日 |
| 稳定模型 ID | grok-4.7 | 请求里要用这个精确字符串 |
| 上下文窗口 | 500,000 token | 长上下文不等于要把全部资料塞进一次请求 |
| 长上下文阈值 | 200,000 提示 token | 超过后整次请求按更高单价计费 |
| 知识截止 | 2026 年 5 月 | 更新年份事实仍需网页搜索或 X 搜索 |
| 输入类型 | 文本、图片 | 输出仅为文本;出图要走独立的 Imagine API |
| Reasoning | low、medium、high、xhigh | 默认 high;不能关闭推理 |
| 主要工具 | 函数调用、网页搜索、X 搜索、代码执行 | 工具调用另计费 |
| Batch API | 不支持 | 不要按这个模型 ID 规划隔夜批量评测 |
| 接入面 | xAI API、Cursor、Grok Build、网关 | Fast 不在公开 API |
模型规格以 xAI 的 和 为准。它可以读取图片,但返回的是文本。如果工作流需要出图或出视频,应连接 Imagine,而不是指望 grok-4.7 直接画图。
500k 上下文适合大型代码库、长会话和文档包。生产系统仍应保留检索、缓存和上下文裁剪,因为输入越长,延迟与账单越容易上升。超过 200k 提示后,整次请求按更高费率计费,这一点比“支持 500k”更影响真实成本。
Grok 4.7 会先出现在哪里?
这次发布覆盖编程客户端、公开 API 和部分网关,但开放节奏并不完全同步。
Cursor 在发布文中被点名为当天可用,且覆盖所有套餐。已经付 Cursor 的 IDE 用户,这是不用单独开 xAI 密钥就能试新模型的最短路径。
Grok Build 把 Grok 4.7 作为默认编程 Agent 模型。xAI 也把人导向 的免费试用。Fast 变体不在这个免费档里。
xAI API 使用模型名 grok-4.7。文档建议新项目走 Responses API,同时也保留 Chat Completions。在 Responses 上,grok-4.7 总会返回 reasoning.encrypted_content,即使 include 没有列出它。如果你自己管理历史,要把这些推理条目原样传回去。
美国区域端点 把推理留在美国,token 用量按全球价的 1.1 倍计费。文档目前列出该端点支持 grok-4.7 和 grok-4.6。详见 xAI 的 。
模型网关 在文档里点到 OpenRouter、Vercel 和 Cloudflare。网关标价不等于 xAI 第一方价格表。看到网关报价,就按网关报价理解。
因此,普通产品接入应以公开 xAI API 上的 grok-4.7 为准。Cursor 里的 Fast、Grok Build 免费档限制和区域驻留,都要单独确认。
Grok 4.7 API 价格
xAI 按输入、缓存输入和输出 token 计价。官方 还把短上下文和长上下文分成两档。
| Token 类型 | 提示低于 200k,每百万 token | 提示达到或超过 200k,每百万 token |
|---|---|---|
| 输入 | $2.00 | $4.00 |
| 缓存输入 | $0.50 | $1.00 |
| 输出 | $6.00 | $12.00 |
提示一旦达到 200k token,长上下文这一列适用于该请求里的全部 token,不只是超出的部分。
假设一次仓库任务发送 100 万未缓存输入 token、生成 20 万输出 token,且都低于长上下文阈值,模型费用大约是 $3.20:输入 $2.00,输出 $1.20。如果同样输入命中缓存,大约是 $1.70。网页搜索、X 搜索和代码执行另算。
更短的任务也可能更贵,只要它跨过 200k。25 万 token 提示加 20 万输出会按长上下文费率计费,大约 $3.40。所以 200k 这条线是运维问题,不是脚注。
Grok 4.7 Fast 是同一模型跑在更快的基础设施上,按标准费率的两倍计费。提示低于 200k 时是 $4.00 / $1.00 / $12.00;超过 200k 是 $6.00 / $1.50 / $18.00。文档写得很清楚:Fast 只在 Cursor 和 Grok Build 提供,不在公开 xAI API,也不包含在 Grok Build 免费档。
Priority processing 是另一套 2 倍加价,用来换 Chat Completions 和 Responses 上更优先的调度。只有响应确认 "service_tier": "priority" 时,才按这个溢价计费。
美国区域请求 再加 10%。grok-4.7 在 200k 以下是每百万 token $2.20 / $0.55 / $6.60。
Grok 4.7 不在 Batch 折扣表里。当前有批量折扣的是更早的 4.3 和 4.20 型号。不要默认 grok-4.7 的隔夜评测会更便宜。
本文核验时,OpenRouter 列出的是输入 / 输出每百万 token $1.60 / $4.80,缓存读取 $0.40。这是网关标价,不是 xAI 官方的 $2 / $6。同一页上的加权均价大约是输入 $0.74、输出 $8.47,已经说明缓存命中和输出结构会怎样改真实账单。
xAI 还说 Grok 4.7“比同类模型快一倍、价格一半”。这句话是发布页对照图表里那组模型的定位,不是对所有前沿模型的通用账单比例。
Grok 4.7 的评测说明了什么
xAI 的发布表把 Grok 4.7 xHigh 和 Grok 4.6 High、GPT-5.6 Sol Max、Fable 5.1 Max 放在一起。公司还发了一张 CursorBench 4.0 分数对平均任务成本的散点图。
在 CursorBench 4.0 上,xAI 把 Grok 4.7 Extra High 放在 46.3%、平均任务成本 $6.01。Fable 5.1 Max 更高,是 51.8%、$17.28。来源:。
散点图才是这次发布真正想讲的论点。Grok 4.7 Extra High 的分数接近 Fable 5.1 Medium 和 Opus 5 Medium,平均任务成本低于 Fable Max 或 Opus Max。它并不在分数轴的最顶端。那张图上最高的仍是 Fable 5.1 Max。
xAI 发布表保留了原始评测名称、脚注和对照模型。Grok 4.7 的 DeepSWE 带星号,表示 high effort。来源:。
| 评测 | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
* xAI 标明 Grok 4.7 的 DeepSWE 使用 high effort。
这张表并没有说它赢下每一行。GPT-5.6 Sol Max 在 DeepSWE 上更高。Fable 5.1 Max 在 CursorBench、Briefcase、Terminal-Bench 和 HealthBench 上更高。Grok 4.7 相对 Grok 4.6 最清楚的官方提升在 CursorBench、EEBench、Briefcase、Terminal-Bench 和 Harvey。这些数字仍是表头努力档下的 xAI 自报结果。
xAI 的 GDPval 面板把 Grok 4.7 xHigh 标为 1695,低于 Fable 5.1 Max 的 1735,高于 Grok 4.6 High 的 1605。来源:。
公司还报告了一套新的安全护栏,LatchBio 生物安全评测 62.4%,以及 HackerBench v0.3 上只有 3.3% 的高风险双用途提示被放行。这些是厂商安全分数,不能替代你们自己的策略、日志和人工审核。
更好的内部测试是用 30 到 100 个代表性任务,记录最终测试是否通过、人工修正次数、工具轮次、输入和输出 token、超时和总费用。一个会想很久的模型,即使单价看起来低,批量跑起来也可能更贵。
独立测试:Artificial Analysis
Artificial Analysis 另有一套 Intelligence Index,并不照抄 xAI 的发布表。2026 年 9 月 22 日,它的 给这个模型的 Intelligence Index v4.3.2 打了 46 分,在 655 个模型里排 第 16。同一页列出 500k 上下文、文本和图片输入、文本输出。
来自 Artificial Analysis 的独立摘要。核验时这张 opengraph 卡上的速度和成本显示为不可用。来源:。
该页还报告 Intelligence Index 跑次大约用了 2.4 亿 输出 token,AA 称这相对中位数 9200 万“非常冗长”。在页面 payload 里,Grok 4.7 xhigh 每个 Index 任务大约用 80,561 个输出 token,其中约 58,544 个是推理 token。
同一模型对象里选出的 AA 分数,四舍五入后如下:
| AA 评测 | Grok 4.7 xhigh | 怎么读 |
|---|---|---|
| Intelligence Index | 46 | 10 项评测的合成,不是 xAI 分数 |
| AA Briefcase Elo | 1,657 | 与 xAI Briefcase 的整数一致 |
| GDPval-AA | 1,695 | 与 xAI 的 GDPval 图一致 |
| AutomationBench-AA | 65.6% | AA 的 Agent 工作流分数 |
| Terminal-Bench 4.0 | 25.8% | 低于 xAI 发布的 38.0% |
| SciCode | 57.4% | AA 科学代码分数 |
| Humanity's Last Exam | 43.1% | AA 的 HLE 分数 |
| AA-Omniscience | 32.0 | 准确率 47.5%,幻觉率 29.3% |
| AA-LCR | 76.7% | 长上下文推理 |
Terminal-Bench 的差距不要抹平。xAI 公布 Grok 4.7 xHigh 是 38.0%。AA 同一页 payload 里独立跑的 Terminal-Bench 4.0 是 25.8%。不同评测运行器、工具、时限和努力档都会移动这个数字。两者都应看成各自方法下的观察,而不是证明某一边算错了。
AA 的公开摘要在核验时还显示输入和输出价格为 $0.00,速度为 N/A。不要把这些零读成免费模型。那只说明这张卡上的实时价格字段是空的。账单仍应以 xAI 价格表或你的网关发票为准。
OpenRouter 在上线当周的流量快照里,已经能看到编程 Agent 流量,包括 Pi 和 Codex 客户端发送数千万 token。这证明有人开始把请求打过来,不是质量排名。
如何调用 Grok 4.7 API
在 创建密钥,放到服务器环境变量 XAI_API_KEY。官方 Python 示例使用 xAI SDK。 也示范了 OpenAI 兼容客户端。
不要把密钥放进浏览器包、公开仓库或前端环境变量。服务端应记录请求 ID、token 用量、推理 token、工具调用次数、延迟和停止原因,并限制重试次数和 Agent 总轮次。
要提高推理强度,把 reasoning.effort 设为 xhigh。默认是 high。推理不能关闭,而且 presencePenalty、frequencyPenalty 和 stop 会在这个模型上报错。
xAI 强烈建议在 Responses 上设置 prompt_cache_key,或在 Chat Completions 上使用 x-grok-conv-id 头。这样会把同一段对话路由到同一台服务器,缓存命中才稳定。不设的话,后续轮次常常 miss cache,按全价输入付费。长 Agent 循环还可以配合 。
一次成功的文本请求还不是生产 Agent。网页搜索、X 搜索和代码执行都有按次费用。客户端仍要处理工具结果、加密推理条目和失败重试。
从 Grok 4.6 迁到 Grok 4.7
如果当前请求只发 model 和文本提示,先把 ID 换成 grok-4.7。列表价没有变。账单仍可能变,因为输出 token、推理 token 和工具轮次会动。
| 当前设置 | Grok 4.7 期望什么 |
|---|---|
模型 ID grok-4.6 | grok-4.7 |
| 关闭推理 | 不支持;默认是 high |
reasoning_effort: xhigh | 支持,和 4.6 一样 |
| 未设置 prompt cache | 设置 prompt_cache_key 或 x-grok-conv-id |
| Batch API 任务 | 4.7 不支持 |
| 提示超过 200k | 整次请求按 $4 / $12 计费 |
| Fast 流量 | 只在 Cursor 或 Grok Build,费率翻倍 |
| Chat Completions 工具循环 | Responses 会默认带回加密推理,不必额外 include |
不要先把全部生产流量切过去。先做影子请求或 5% 到 10% 的金丝雀,按完成率、输出长度、工具错误和总花费比较 4.6 与 4.7。确认回滚、超时处理和用量日志可用后再扩大。
Agent 行为的变化很容易读错。更长的自检看起来更慢,却可能提高任务完成率。应测量到达可接受业务结果所需的成本和时间,而不是只看单次回复延迟。
Grok 4.7 对比 Grok 4.6
| 工作负载 | 先测 Grok 4.7 | 比较里仍保留 Grok 4.6 |
|---|---|---|
| Cursor 或 Grok Build 里的长编程任务 | 发布当天可接入,CursorBench 提升正是这次重点 | 现有 4.6 流程已经稳定达标 |
| 文档、幻灯片和办公 Agent | xAI 和 AA 都显示 Briefcase 与 GDPval 上升 | 4.6 上输出本来就短、也便宜 |
| 电气或法律 Agent 任务 | 官方 EEBench 和 Harvey 相对 4.6 的差距很大 | 你已经有该领域的专用工具 |
| 对成本敏感的批量任务 | 仅当缓存命中稳定、提示也低于 200k | 4.7 没有批量折扣 |
| 低延迟交互 | 试 low effort,或在 Cursor / Grok Build 里用 Fast | 公开 API 没有 Fast |
| 生产迁移 | 已有金丝雀、回滚和任务级评测 | 没有可靠验收集或用量监控 |
这次发布文没有宣布 Grok 4.6 的下线日期。把 4.6 留作回滚和效率对照,而不是只因为有了新版本就立刻退役。
如果模型会放进 IDE 或终端工作流,先看 Mengbi 的 。同期 OpenAI 旗舰见 。Anthropic 的长时 Agent 模型见 。也可以 。
上线前如何评估 Grok 4.7
一套可复用的记分卡至少应记录这些字段:
- 任务是否完成、最终测试是否通过。
- 追问次数和人工修改次数。
- 输入、缓存输入、推理和输出 token,以及总费用。
- 工具调用总数、失败次数和重复调用。
- 首 token、回复和完成任务的 P50 / P95 时间。
- 超时、限流、空响应和 schema 解析失败。
- 安全拒答、事实错误,以及引用答案能否核对。
不要只拿成功演示来组测试集。应包含含糊请求、死链、过大文件、工具错误、重复函数结果和手机截图。每条样本的输入、验收脚本和人工打分规则要固定。否则测的是提示词,不是模型版本。
xAI 仍说明,没有搜索工具时 Grok 不知道当前事件。医疗、法律、金融、高权限操作和网络安全工作流仍需要人工审核和系统级权限控制。发布文提到的受邀红队能力,不是公开 API 功能。
常见问题
Grok 4.7 什么时候发布?
xAI 于 2026 年 9 月 21 日发布 Grok 4.7。开发者可通过 xAI API、Cursor、Grok Build 和部分模型网关使用稳定模型 grok-4.7。
Grok 4.7 API 多少钱?
官方标准价在提示低于 200k token 时,是输入每百万 token $2.00、缓存输入 $0.50、输出 $6.00。提示达到或超过 200k 后,费率是 $4.00、$1.00 和 $12.00。网关标价可能不同。
Grok 4.7 的上下文窗口是多少?
官方文档列出 500,000 token。这不是部分旧版 Grok 4.20 和 Grok 4.1 Fast 页面上的 200 万 token 窗口。提示达到或超过 200k token 还会触发更高费率。
Grok 4.7 能看图片吗?
能。它接受文本和图片输入,返回文本。它不生成图片。图像或视频输出应使用 Imagine API。
Grok 4.7 能配合 OpenAI SDK 吗?
能。xAI 在 里给出了 OpenAI 兼容客户端写法。使用你的 xAI 密钥和模型 grok-4.7。上线前要测流式、工具调用、加密推理和错误处理。
Grok 4.7 Fast 在公开 API 上吗?
不在。Fast 是同一模型跑在更快基础设施上,token 费率翻倍,文档把它限制在 Cursor 和 Grok Build。它也不在 Grok Build 免费档。
现在每个 Grok 4.6 工作负载都该升级吗?
不必。把 4.7 放进更长的编程任务、办公文档 Agent,以及 4.6 已经做不好的任务里测试。4.6 已经达标或更省 token 的地方先留着,再按任务成功率、延迟和总费用做金丝雀。
来源与核验说明
本文的模型规格、价格、迁移步骤和厂商评测数字来自 xAI 来源:
独立观察和网关观察来自 2026 年 9 月 22 日核验的 和 。文中图表来自 xAI 发布页,用于评论并注明来源。Mengbi 没有用付费 API 密钥重跑这些评测,也没有接受 xAI 赞助。价格、模型状态和网关费率可能变化,采购或生产上线前请再查官方页面。
最后核验:2026 年 9 月 22 日。

