约 7 分钟阅读

Grok 4.7 API 值得升级吗?价格、评测与迁移要点

Grok 4.7 API 值得升级吗?价格、评测与迁移要点

TL;DR

Grok 4.7 于 2026 年 9 月 21 日发布,API 模型名为 grok-4.7。官方文档给出 500,000 token 上下文,支持文本和图片输入、文本输出。标准价是输入每百万 token 2 美元、输出 6 美元,提示低于 200k token 时按此计费。xAI 称它在更长的编程和办公评测上超过 Grok 4.6,列表价相同。Fast 变体只在 Cursor 和 Grok Build 提供,价格翻倍,不在公开 xAI API 上。

xAI Grok 4.7 官方发布图。来源:

Grok 4.7 API 已于 2026 年 9 月 21 日发布,稳定模型 ID 是 grok-4.7。官方文档给出 500,000 token 上下文窗口,支持文本和图片输入、文本输出,也可配置推理强度,并使用函数调用、网页搜索、X 搜索和代码执行。

这次更新的重点不是又一个更大的窗口数字。Grok 4.7 沿用 Grok 4.6 的每百万 token 2 美元 / 6 美元列表价。xAI 称它能在困难任务上工作更久、更认真地检查自己的结果,并处在 CursorBench 4.0 的性价比前沿。采购时要把列表价和评测声明分开看:公布费率是官方价格;评测领先是指定设置下的厂商结果。

另一个容易传错的点是上下文长度。更早的 Grok 4.20 和 Grok 4.1 Fast 页面仍会出现 200 万 token 窗口。Grok 4.7 不是这个规格。当前模型页和价格表都写的是 500k token,提示达到 200k 后还会改用更高费率。

下面把模型规格、xAI 公布的评测、Artificial Analysis 独立分数和迁移风险分开说明。Mengbi 没有为本文跑付费 Grok 4.7 API 测试。

Grok 4.7 API 关键信息

项目官方信息对接时要注意什么
发布时间2026 年 9 月 21 日本文核验于 2026 年 9 月 22 日
稳定模型 IDgrok-4.7请求里要用这个精确字符串
上下文窗口500,000 token长上下文不等于要把全部资料塞进一次请求
长上下文阈值200,000 提示 token超过后整次请求按更高单价计费
知识截止2026 年 5 月更新年份事实仍需网页搜索或 X 搜索
输入类型文本、图片输出仅为文本;出图要走独立的 Imagine API
Reasoninglowmediumhighxhigh默认 high;不能关闭推理
主要工具函数调用、网页搜索、X 搜索、代码执行工具调用另计费
Batch API不支持不要按这个模型 ID 规划隔夜批量评测
接入面xAI API、Cursor、Grok Build、网关Fast 不在公开 API

模型规格以 xAI 的 为准。它可以读取图片,但返回的是文本。如果工作流需要出图或出视频,应连接 Imagine,而不是指望 grok-4.7 直接画图。

500k 上下文适合大型代码库、长会话和文档包。生产系统仍应保留检索、缓存和上下文裁剪,因为输入越长,延迟与账单越容易上升。超过 200k 提示后,整次请求按更高费率计费,这一点比“支持 500k”更影响真实成本。

Grok 4.7 会先出现在哪里?

这次发布覆盖编程客户端、公开 API 和部分网关,但开放节奏并不完全同步。

Cursor 在发布文中被点名为当天可用,且覆盖所有套餐。已经付 Cursor 的 IDE 用户,这是不用单独开 xAI 密钥就能试新模型的最短路径。

Grok Build 把 Grok 4.7 作为默认编程 Agent 模型。xAI 也把人导向 的免费试用。Fast 变体不在这个免费档里。

xAI API 使用模型名 grok-4.7。文档建议新项目走 Responses API,同时也保留 Chat Completions。在 Responses 上,grok-4.7 总会返回 reasoning.encrypted_content,即使 include 没有列出它。如果你自己管理历史,要把这些推理条目原样传回去。

美国区域端点 把推理留在美国,token 用量按全球价的 1.1 倍计费。文档目前列出该端点支持 grok-4.7grok-4.6。详见 xAI 的

模型网关 在文档里点到 OpenRouter、Vercel 和 Cloudflare。网关标价不等于 xAI 第一方价格表。看到网关报价,就按网关报价理解。

因此,普通产品接入应以公开 xAI API 上的 grok-4.7 为准。Cursor 里的 Fast、Grok Build 免费档限制和区域驻留,都要单独确认。

Grok 4.7 API 价格

xAI 按输入、缓存输入和输出 token 计价。官方 还把短上下文和长上下文分成两档。

Token 类型提示低于 200k,每百万 token提示达到或超过 200k,每百万 token
输入$2.00$4.00
缓存输入$0.50$1.00
输出$6.00$12.00

提示一旦达到 200k token,长上下文这一列适用于该请求里的全部 token,不只是超出的部分。

假设一次仓库任务发送 100 万未缓存输入 token、生成 20 万输出 token,且都低于长上下文阈值,模型费用大约是 $3.20:输入 $2.00,输出 $1.20。如果同样输入命中缓存,大约是 $1.70。网页搜索、X 搜索和代码执行另算。

更短的任务也可能更贵,只要它跨过 200k。25 万 token 提示加 20 万输出会按长上下文费率计费,大约 $3.40。所以 200k 这条线是运维问题,不是脚注。

Grok 4.7 Fast 是同一模型跑在更快的基础设施上,按标准费率的两倍计费。提示低于 200k 时是 $4.00 / $1.00 / $12.00;超过 200k 是 $6.00 / $1.50 / $18.00。文档写得很清楚:Fast 只在 Cursor 和 Grok Build 提供,不在公开 xAI API,也不包含在 Grok Build 免费档。

Priority processing 是另一套 2 倍加价,用来换 Chat Completions 和 Responses 上更优先的调度。只有响应确认 "service_tier": "priority" 时,才按这个溢价计费。

美国区域请求 再加 10%。grok-4.7 在 200k 以下是每百万 token $2.20 / $0.55 / $6.60。

Grok 4.7 不在 Batch 折扣表里。当前有批量折扣的是更早的 4.3 和 4.20 型号。不要默认 grok-4.7 的隔夜评测会更便宜。

本文核验时,OpenRouter 列出的是输入 / 输出每百万 token $1.60 / $4.80,缓存读取 $0.40。这是网关标价,不是 xAI 官方的 $2 / $6。同一页上的加权均价大约是输入 $0.74、输出 $8.47,已经说明缓存命中和输出结构会怎样改真实账单。

xAI 还说 Grok 4.7“比同类模型快一倍、价格一半”。这句话是发布页对照图表里那组模型的定位,不是对所有前沿模型的通用账单比例。

Grok 4.7 的评测说明了什么

xAI 的发布表把 Grok 4.7 xHigh 和 Grok 4.6 High、GPT-5.6 Sol Max、Fable 5.1 Max 放在一起。公司还发了一张 CursorBench 4.0 分数对平均任务成本的散点图。

官方 CursorBench 4.0 图,按平均任务成本比较 Grok 4.7 与 Fable 5.1、Opus 5、GPT-5.6 Sol 和 Sonnet 5 在 CursorBench 4.0 上,xAI 把 Grok 4.7 Extra High 放在 46.3%、平均任务成本 $6.01。Fable 5.1 Max 更高,是 51.8%、$17.28。来源:

散点图才是这次发布真正想讲的论点。Grok 4.7 Extra High 的分数接近 Fable 5.1 Medium 和 Opus 5 Medium,平均任务成本低于 Fable Max 或 Opus Max。它并不在分数轴的最顶端。那张图上最高的仍是 Fable 5.1 Max。

官方 Grok 4.7 表格,覆盖 token 价格和七项编程、办公、法律与临床评测 xAI 发布表保留了原始评测名称、脚注和对照模型。Grok 4.7 的 DeepSWE 带星号,表示 high effort。来源:

评测Grok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

* xAI 标明 Grok 4.7 的 DeepSWE 使用 high effort。

这张表并没有说它赢下每一行。GPT-5.6 Sol Max 在 DeepSWE 上更高。Fable 5.1 Max 在 CursorBench、Briefcase、Terminal-Bench 和 HealthBench 上更高。Grok 4.7 相对 Grok 4.6 最清楚的官方提升在 CursorBench、EEBench、Briefcase、Terminal-Bench 和 Harvey。这些数字仍是表头努力档下的 xAI 自报结果。

官方 GDPval 图,比较 Grok 4.7、Grok 4.6、Fable 5.1 和 GPT-6 Astra xAI 的 GDPval 面板把 Grok 4.7 xHigh 标为 1695,低于 Fable 5.1 Max 的 1735,高于 Grok 4.6 High 的 1605。来源:

公司还报告了一套新的安全护栏,LatchBio 生物安全评测 62.4%,以及 HackerBench v0.3 上只有 3.3% 的高风险双用途提示被放行。这些是厂商安全分数,不能替代你们自己的策略、日志和人工审核。

更好的内部测试是用 30 到 100 个代表性任务,记录最终测试是否通过、人工修正次数、工具轮次、输入和输出 token、超时和总费用。一个会想很久的模型,即使单价看起来低,批量跑起来也可能更贵。

独立测试:Artificial Analysis

Artificial Analysis 另有一套 Intelligence Index,并不照抄 xAI 的发布表。2026 年 9 月 22 日,它的 给这个模型的 Intelligence Index v4.3.2 打了 46 分,在 655 个模型里排 第 16。同一页列出 500k 上下文、文本和图片输入、文本输出。

Artificial Analysis 的 Grok 4.7 xhigh 摘要卡,Intelligence Index 为 46,每任务约 81k token 来自 Artificial Analysis 的独立摘要。核验时这张 opengraph 卡上的速度和成本显示为不可用。来源:

该页还报告 Intelligence Index 跑次大约用了 2.4 亿 输出 token,AA 称这相对中位数 9200 万“非常冗长”。在页面 payload 里,Grok 4.7 xhigh 每个 Index 任务大约用 80,561 个输出 token,其中约 58,544 个是推理 token。

同一模型对象里选出的 AA 分数,四舍五入后如下:

AA 评测Grok 4.7 xhigh怎么读
Intelligence Index4610 项评测的合成,不是 xAI 分数
AA Briefcase Elo1,657与 xAI Briefcase 的整数一致
GDPval-AA1,695与 xAI 的 GDPval 图一致
AutomationBench-AA65.6%AA 的 Agent 工作流分数
Terminal-Bench 4.025.8%低于 xAI 发布的 38.0%
SciCode57.4%AA 科学代码分数
Humanity's Last Exam43.1%AA 的 HLE 分数
AA-Omniscience32.0准确率 47.5%,幻觉率 29.3%
AA-LCR76.7%长上下文推理

Terminal-Bench 的差距不要抹平。xAI 公布 Grok 4.7 xHigh 是 38.0%。AA 同一页 payload 里独立跑的 Terminal-Bench 4.0 是 25.8%。不同评测运行器、工具、时限和努力档都会移动这个数字。两者都应看成各自方法下的观察,而不是证明某一边算错了。

AA 的公开摘要在核验时还显示输入和输出价格为 $0.00,速度为 N/A。不要把这些零读成免费模型。那只说明这张卡上的实时价格字段是空的。账单仍应以 xAI 价格表或你的网关发票为准。

OpenRouter 在上线当周的流量快照里,已经能看到编程 Agent 流量,包括 Pi 和 Codex 客户端发送数千万 token。这证明有人开始把请求打过来,不是质量排名。

如何调用 Grok 4.7 API

创建密钥,放到服务器环境变量 XAI_API_KEY。官方 Python 示例使用 xAI SDK。 也示范了 OpenAI 兼容客户端。

bash
pip install -U xai-sdk
python
import osfrom xai_sdk import Clientfrom xai_sdk.chat import user
client = Client(api_key=os.environ["XAI_API_KEY"], timeout=3600)
chat = client.chat.create(model="grok-4.7")chat.append(user("Find and fix the bug, then explain it: function median(a){a.sort();return a[a.length/2]}"))response = chat.sample()print(response.content)

不要把密钥放进浏览器包、公开仓库或前端环境变量。服务端应记录请求 ID、token 用量、推理 token、工具调用次数、延迟和停止原因,并限制重试次数和 Agent 总轮次。

要提高推理强度,把 reasoning.effort 设为 xhigh。默认是 high。推理不能关闭,而且 presencePenaltyfrequencyPenaltystop 会在这个模型上报错。

python
import osfrom xai_sdk import Clientfrom xai_sdk.chat import user
client = Client(api_key=os.environ["XAI_API_KEY"], timeout=3600)
chat = client.chat.create(model="grok-4.7", reasoning_effort="xhigh")chat.append(user("Create a testable migration checklist for this API change."))response = chat.sample()print(response.content)

xAI 强烈建议在 Responses 上设置 prompt_cache_key,或在 Chat Completions 上使用 x-grok-conv-id 头。这样会把同一段对话路由到同一台服务器,缓存命中才稳定。不设的话,后续轮次常常 miss cache,按全价输入付费。长 Agent 循环还可以配合

一次成功的文本请求还不是生产 Agent。网页搜索、X 搜索和代码执行都有按次费用。客户端仍要处理工具结果、加密推理条目和失败重试。

从 Grok 4.6 迁到 Grok 4.7

如果当前请求只发 model 和文本提示,先把 ID 换成 grok-4.7。列表价没有变。账单仍可能变,因为输出 token、推理 token 和工具轮次会动。

当前设置Grok 4.7 期望什么
模型 ID grok-4.6grok-4.7
关闭推理不支持;默认是 high
reasoning_effort: xhigh支持,和 4.6 一样
未设置 prompt cache设置 prompt_cache_keyx-grok-conv-id
Batch API 任务4.7 不支持
提示超过 200k整次请求按 $4 / $12 计费
Fast 流量只在 Cursor 或 Grok Build,费率翻倍
Chat Completions 工具循环Responses 会默认带回加密推理,不必额外 include

不要先把全部生产流量切过去。先做影子请求或 5% 到 10% 的金丝雀,按完成率、输出长度、工具错误和总花费比较 4.6 与 4.7。确认回滚、超时处理和用量日志可用后再扩大。

Agent 行为的变化很容易读错。更长的自检看起来更慢,却可能提高任务完成率。应测量到达可接受业务结果所需的成本和时间,而不是只看单次回复延迟。

Grok 4.7 对比 Grok 4.6

工作负载先测 Grok 4.7比较里仍保留 Grok 4.6
Cursor 或 Grok Build 里的长编程任务发布当天可接入,CursorBench 提升正是这次重点现有 4.6 流程已经稳定达标
文档、幻灯片和办公 AgentxAI 和 AA 都显示 Briefcase 与 GDPval 上升4.6 上输出本来就短、也便宜
电气或法律 Agent 任务官方 EEBench 和 Harvey 相对 4.6 的差距很大你已经有该领域的专用工具
对成本敏感的批量任务仅当缓存命中稳定、提示也低于 200k4.7 没有批量折扣
低延迟交互low effort,或在 Cursor / Grok Build 里用 Fast公开 API 没有 Fast
生产迁移已有金丝雀、回滚和任务级评测没有可靠验收集或用量监控

这次发布文没有宣布 Grok 4.6 的下线日期。把 4.6 留作回滚和效率对照,而不是只因为有了新版本就立刻退役。

如果模型会放进 IDE 或终端工作流,先看 Mengbi 的 。同期 OpenAI 旗舰见 。Anthropic 的长时 Agent 模型见 。也可以

上线前如何评估 Grok 4.7

一套可复用的记分卡至少应记录这些字段:

  1. 任务是否完成、最终测试是否通过。
  2. 追问次数和人工修改次数。
  3. 输入、缓存输入、推理和输出 token,以及总费用。
  4. 工具调用总数、失败次数和重复调用。
  5. 首 token、回复和完成任务的 P50 / P95 时间。
  6. 超时、限流、空响应和 schema 解析失败。
  7. 安全拒答、事实错误,以及引用答案能否核对。

不要只拿成功演示来组测试集。应包含含糊请求、死链、过大文件、工具错误、重复函数结果和手机截图。每条样本的输入、验收脚本和人工打分规则要固定。否则测的是提示词,不是模型版本。

xAI 仍说明,没有搜索工具时 Grok 不知道当前事件。医疗、法律、金融、高权限操作和网络安全工作流仍需要人工审核和系统级权限控制。发布文提到的受邀红队能力,不是公开 API 功能。

常见问题

Grok 4.7 什么时候发布?

xAI 于 2026 年 9 月 21 日发布 Grok 4.7。开发者可通过 xAI API、Cursor、Grok Build 和部分模型网关使用稳定模型 grok-4.7

Grok 4.7 API 多少钱?

官方标准价在提示低于 200k token 时,是输入每百万 token $2.00、缓存输入 $0.50、输出 $6.00。提示达到或超过 200k 后,费率是 $4.00、$1.00 和 $12.00。网关标价可能不同。

Grok 4.7 的上下文窗口是多少?

官方文档列出 500,000 token。这不是部分旧版 Grok 4.20 和 Grok 4.1 Fast 页面上的 200 万 token 窗口。提示达到或超过 200k token 还会触发更高费率。

Grok 4.7 能看图片吗?

能。它接受文本和图片输入,返回文本。它不生成图片。图像或视频输出应使用 Imagine API。

Grok 4.7 能配合 OpenAI SDK 吗?

能。xAI 在 里给出了 OpenAI 兼容客户端写法。使用你的 xAI 密钥和模型 grok-4.7。上线前要测流式、工具调用、加密推理和错误处理。

Grok 4.7 Fast 在公开 API 上吗?

不在。Fast 是同一模型跑在更快基础设施上,token 费率翻倍,文档把它限制在 Cursor 和 Grok Build。它也不在 Grok Build 免费档。

现在每个 Grok 4.6 工作负载都该升级吗?

不必。把 4.7 放进更长的编程任务、办公文档 Agent,以及 4.6 已经做不好的任务里测试。4.6 已经达标或更省 token 的地方先留着,再按任务成功率、延迟和总费用做金丝雀。

来源与核验说明

本文的模型规格、价格、迁移步骤和厂商评测数字来自 xAI 来源:

独立观察和网关观察来自 2026 年 9 月 22 日核验的 。文中图表来自 xAI 发布页,用于评论并注明来源。Mengbi 没有用付费 API 密钥重跑这些评测,也没有接受 xAI 赞助。价格、模型状态和网关费率可能变化,采购或生产上线前请再查官方页面。

最后核验:2026 年 9 月 22 日。

文中提到的 AI 工具

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。