TL;DR
GLM-5.3-Flash API 已经上线,模型名为 glm-5.3-flash。官方文档确认它支持 1M token 上下文、原生图片输入、Function Calling、结构化输出和不能关闭的深度思考。限时价格为输入每百万 token 0.075 美元、输出每百万 token 0.25 美元,优惠截至 2026 年 9 月 9 日 24:00,时区为 UTC+8。发布 benchmark 很亮眼,但主要来自厂商评测,正式接入前仍应使用自己的任务集验证。
Mengbi 原创编辑封面,没有复刻官方 benchmark 图表。
GLM-5.3-Flash API 已经正式上线。它不只是给 GLM-5.3 后面加了一个 Flash 后缀,而是换用了新的基础模型、混合注意力架构和多模态预训练方案。官方模型名是 glm-5.3-flash,支持 1M token 上下文、图片输入、工具调用、结构化输出和开源权重。
这次发布真正值得关注的,是能力和价格同时进入了一个更适合 Agent 大量调用的区间。智谱给出的结论是:GLM-5.3-Flash 在多项评测中超过 GLM-5.2,常规定价只有 GLM-5.3 的十分之一。限时折扣期间,价格差距还会再拉大。
但热度越高,越需要把几件事分开看。限时价格不是长期价格,官方 benchmark 不是 Mengbi 独立实测,归藏对“牛来”的三个前端案例也属于个人体验。本文会把 API 事实、厂商评测和早期实测分别说明,方便你判断它是否适合自己的工作流。
GLM-5.3-Flash API 关键信息
如果你只想得到一个简短建议,可以先把 GLM-5.3-Flash 放进低成本、多模态或长上下文任务的候选列表,再拿现有主力模型做同任务对照。不要一看到 1M 上下文就把整个仓库无差别塞进去,也不要因为单价低就取消重试和预算上限。
想看另一个新上线的低成本多模态 API,可以对照 Mengbi 的 。两者都支持视觉输入,但模型定位、限制和接入细节并不相同。
GLM-5.3-Flash API 价格
Z.ai 官方同时列出了限时折扣和正常价格,单位均为每百万 token。
限时优惠会在 2026 年 9 月 9 日 24:00 结束,时区为 UTC+8 新加坡时间。如果你的预算只按折扣价计算,优惠结束后,同样的 token 组合会直接翻倍。正式上线前最好同时保留折扣预算和常规预算。
即使恢复正常价格,它仍明显低于 GLM-5.3。当前 GLM-5.3 的官方输入价是每百万 token 1.40 美元,输出价是 4.40 美元。按同一张价格表计算,GLM-5.3-Flash 的常规定价大约是它的十分之一。
官方还把限时价格描述为 GLM-5.3 的二十分之一、Claude Opus 4.8 的四十分之一。前一个比例可以直接从 Z.ai 自己的表格复核。Opus 的比例取决于智谱采用的 Anthropic 价格和任务假设,更适合看作发布定位,不应该直接套到所有真实账单上。
一次调用大概多少钱?
假设一个代码库任务使用 100 万未缓存输入 token,并产生 20 万输出 token。折扣期间,模型 token 成本约为 0.125 美元,其中输入 0.075 美元,输出 0.05 美元。恢复正常价格后,同样的 token 组合约为 0.25 美元。
如果一个批处理任务累计使用 1000 万输入 token 和 200 万输出 token,折扣期间约为 1.25 美元,正常价格约为 2.50 美元。这里没有加入额外工具费用。Z.ai 当前把网页搜索定为每次 0.01 美元,频繁搜索的 Agent 可能出现工具调用费高于模型 token 费的情况。
API 计费和 GLM Coding Plan 也不是一回事。Coding Plan 使用积分配额,GLM-5.3-Flash 当前可用额度是 GLM-5.3 的三倍,周末和低峰时段只消耗一半积分。它适合受支持的编程客户端,但不能把积分配额直接换算成服务端 API 单价。
GLM-5.3-Flash Benchmark 应该怎么看?
官方发布图覆盖了六项编程、Agent 和专业任务评测。GLM-5.3-Flash 在图中全面超过 GLM-5.2,其中差距较大的两项是 DeepSWE v1.1 的 63.4 对 46.2,以及 AutomationBench 的 48.8 对 26.2。Terminal Bench 2.1 得分为 84.3,带工具的 HLE 得分为 55.3。
图片来自 Z.ai 官方发布页。不同评测使用不同的运行方式与参数,只能在各自设定内比较。来源:。
这张图并没有显示它在所有项目都第一。Terminal Bench 2.1 上,GLM-5.3-Flash 是 84.3,Claude Opus 4.8 是 85.0。Agents' Last Exam 上,它是 26.3,Claude Opus 4.8 是 27.0,GPT-5.6 是 28.0。更准确的说法是,它在低价位进入了前沿模型的竞争区间,而不是已经证明自己是所有任务的通用第一名。
评测脚注同样重要。DeepSWE 使用 mini-swe-agent,超时为 6 小时,上下文为 400K。Terminal Bench 2.1 运行在 Claude Code 2.1.207 中,超时也是 6 小时,最大生成长度为 65,536 token。带工具的 HLE 使用最大 300K 上下文和上下文管理,并让 GPT-5.6 Luna 担任裁判模型。
这些设置不一定有问题,但它们共同定义了成绩。更换 Agent、超时、工具、采样参数或代码仓库集合,结果都可能变化。最合理的用法,是把官方数字当成进入测试名单的理由,然后用自己的任务和验收标准复测。
Artificial Analysis 的成本性能图说明了什么?
Z.ai 还把 GLM-5.3-Flash 放进了 Artificial Analysis Intelligence Index v4.1.1。图中给出的综合得分是 57,折扣期单任务估算成本是 0.045 美元。按这张图的口径,它位于帕累托前沿,也就是图中没有更便宜同时得分更高的模型。
图中保留了 Artificial Analysis 来源和 2026 年 8 月 26 日更新时间。0.045 美元是该评测方法估算的单任务成本,不是所有 API 请求的固定价格。来源:。
这张图的价值在于使用同一种外部方法比较了多款模型,但它仍不能代替你的账单和任务测试。综合指数会把多项评测压缩成一个分数,单任务成本也取决于评测本身用了多少输入和输出 token,以及当时采用的是不是限时价格。
为什么它在长上下文下更省?
GLM-5.3-Flash 是一个总参数 320B、激活参数 18B 的混合专家模型。Z.ai 表示,它从新训练的基础模型出发,使用了 30T token 的多模态预训练语料。与 GLM-4.5 系列相比,层数从 92 降到 45,激活参数从 32B 降到 18B。
更特别的是注意力设计。线性注意力通过紧凑状态处理局部依赖,稀疏注意力通过 Indexer 从全局上下文中选出相关内容。IndexPool 会把四组 Indexer Key 向量加权压缩成一组,再进行稀疏检索。模型还采用了流形约束超连接,也就是 mHC,连接注意力层和专家层。
Z.ai 报告称,在 1M token 序列下,它的单层 KV Cache 比 GLM-5.3 少 4.44 倍,单层注意力计算少 3.01 倍。来源:。
这些倍数是智谱对架构计算量的说明,不代表每个真实请求都会快 3 倍或 4 倍。端到端延迟还会受到硬件、批处理、量化方式、输出长度和服务框架影响。架构更省,首先意味着 1M 上下文的服务成本更容易控制,不等于长提示词可以不做筛选。
官方已经在 发布 MIT License 权重,并列出 SGLang、vLLM、TokenSpeed 和 KTransformers 等部署路径。开源不等于能在普通笔记本上轻松运行。总参数仍然是 320B,自部署需要足够的显存或内存、合适的量化方案和成熟的推理服务配置。
GLM-5.3-Flash API 怎么调用?
Z.ai 通用 API 地址是 https://api.z.ai/api/paas/v4。在控制台创建 API Key 后,把 Key 存到服务端环境变量,并使用 glm-5.3-flash 作为模型名。官方 确认使用 Bearer 鉴权, 则提供了 OpenAI SDK 兼容方式。
使用 curl 调用
Z.ai 推荐这个模型使用 temperature: 1、top_p: 0.95 和 reasoning_effort: max。Thinking 始终开启,thinking.type 只支持 enabled。官方还建议把 clear_thinking 设为 false,让多轮任务能够延续之前的思考状态。
生产服务不要把 Key 写进浏览器代码或提交到 Git 的 .env 文件。请求需要超时、有限重试、token 用量记录和 Agent 轮数预算。单价低让反复检查更便宜,但不代表可以放任循环一直跑下去。
使用 OpenAI Python SDK 调用
示例通过 extra_body 传入 Z.ai 的 thinking 对象,因为它在部分 OpenAI SDK 版本中不是标准 Chat Completions 参数。上线前要锁定并测试实际使用的 SDK 版本。以上代码根据官方请求格式整理,Mengbi 没有使用付费 Key 实际发起这两次请求。
GLM-5.3-Flash 怎么传图片?
原生多模态输入,是它和低价纯文本模型最明显的区别。把提示词和一个或多个 image_url block 放进 user 消息即可。Z.ai 更推荐可访问的图片 URL,也支持 Base64 Data URL。
需要传多张图时,就加入多个 image_url block。官方模型页还列出了视频和文件理解,不过页面中的 Chat Completions 示例只明确展示了图片 URL 与 Base64。不要看到“支持视频和文件”就默认本地视频可以直接塞进同一个请求体,正式接入前要验证对应的上传接口和媒体格式。
放到编程 Agent 里,最有价值的不是让模型“看懂一张图”,而是形成观察闭环:写代码、启动页面、截图、对照参考图、修改、再次截图。Mengbi 的 介绍了 IDE 和终端层的工具选择。GLM-5.3-Flash 提供模型能力,浏览器、截图通道、测试和停止条件仍然要由 Agent 系统补齐。
“牛来”早期实测补上了什么信息?
正式公开身份之前,Z.ai 曾用 Ox Alpha 这个匿名名称在 OpenCode 和 OpenRouter 提供 GLM-5.3-Flash。中文社区把它叫作“牛来”。智谱表示,它成为当周最受欢迎的模型,相关流量运行在国产 AI 芯片上。这些属于厂商发布信息,不是第三方流量审计。
用户补充的更值得看的部分,是三个有具体技术门槛的前端任务。它没有只说“代码能力很强”,而是给出参考材料、提示方式、模型选择的实现方案和可见问题。
第一个任务只给一张海报参考图。画面核心是两个可交互的 WebGL 玻璃立方体,玻璃后方还有复杂排版。归藏记录到,模型使用离屏 Canvas 绘制文字,再把文字平面放到玻璃后方,让透射和折射作用在真实排版上。它还加入拖拽旋转、惯性和鼠标视差。
第二个任务给的是多页面网站录屏。核心视觉是一条由 60 片玻璃板组成的 3D 螺旋彩带,会随滚动在多个姿态间切换,并响应拖拽和 Hover。第一轮结果的玻璃朝向不对,归藏补充一句“玻璃片应该互相面对面,窄边朝向镜头”后完成修正。这个案例比静态截图多考了一层:模型需要从动态帧推断滚动状态、悬停响应和环境光。
第三个任务不是复刻,而是把一张体素海报发展成交互网页。提示要求页面刚开始看不到图案,随着滚动,覆盖方块逐渐掉落,最后露出完整标志。模型使用 InstancedMesh 构建体素对象,把主体和覆盖层拆开,再让每个方块按滚动进度拥有独立的下落和旋转。
这三个案例给官方 benchmark 补上了一个更接近真实开发的视角:模型会做哪些技术推断,哪里需要人类追加一句反馈,以及视觉结果能不能继续修改。不过它们仍然只是一个作者挑选的三个任务。Mengbi 没有复现,也不能据此推出 GLM-5.3-Flash 在所有前端任务都优于 DeepSeek、Claude 或其他模型。
最合适的借鉴方式,是把这些任务变成自己的测试模板。准备同一张参考图、同一段录屏、同一组 viewport 和验收截图,让不同模型完成相同任务。比较最终还原度、修改轮数、总 token、工具失败和人工修正时间,比只看“第一次生成很惊艳”更有意义。
GLM-5.3-Flash 和 GLM-5.3 怎么选?
GLM-5.3-Flash 更适合作为经济型默认模型,GLM-5.3 则可以留在高难任务对照组。两者都面向长上下文和 Agent 工作,但 Flash 版本加入原生多模态视觉编程,并把 token 价格压低了一个数量级。
一个实用的模型路由,可以先让 GLM-5.3-Flash 完成任务,再用外部验收判断是否升级。代码要跑测试和检查 diff,网页要固定 viewport 对比截图,表格和报告要检查公式、引用、溢出和导出文件。判断标准不能由同一个模型自己说了算。
也不要只按 benchmark 得分路由。需要记录成功率、延迟、token、工具错误和人工修正量。如果便宜模型要完整重跑三次,实际成本可能高于一次完成的贵模型。低单价真正有用的前提,是系统能够识别“看起来合理”和“真的通过验收”的区别。
第一次接入应该验证什么?
先选一种任务、一个对照模型和一小组能够人工检查的样本。每次记录提示词、模型名、输入素材、请求参数、usage、工具调用、最终文件和审核修改。这样得到的数据,比“我感觉它像 Opus”更能回答是否应该迁移。
图片和其他不可信输入要与密钥隔离。截图里可能包含提示注入、个人信息或账号凭据。Agent 能调用哪些工具、能不能向外部系统写入、最多花多少钱和跑多少轮,都要提前限制。长上下文也只应该放入支持任务的材料,不能因为窗口够大就取消筛选。
最后给请求格式加一条契约测试,固定检查 base URL、模型名、图片 block、thinking 参数、流式解析和 usage 字段。Z.ai 明确说明 GLM-5.3-Flash 不能关闭 thinking。如果现有集成假设响应来自纯文本、非推理模型,即使 HTTP 请求成功,后续解析和会话管理也可能出错。
常见问题
GLM-5.3-Flash API 已经可以用了吗?
可以。Z.ai 已在官方 API 平台记录模型名 glm-5.3-flash,价格页也已经列出对应费率。它同时进入 GLM Coding Plan,开源权重则发布在 Hugging Face。
GLM-5.3-Flash API 多少钱?
截至 2026 年 9 月 9 日 24:00,时区为 UTC+8,官方限时价格为输入每百万 token 0.075 美元、缓存输入 0.015 美元、输出 0.25 美元。正常价格分别是 0.15、0.03 和 0.50 美元。
GLM-5.3-Flash 上下文是多少?
官方文档写的是 100 万 token。窗口很大不代表提示词里每一部分都会得到同样关注,正式使用时仍需在目标长度下测试检索、事实保持和答案准确度。
GLM-5.3-Flash 支持图片吗?
支持。在 user 消息中加入 image_url block,并传入公网 URL 或 Base64 Data URL。多张图片需要多个 block。模型输出仍然是文本,它不是图片生成 API。需要选择生图产品时,可以看 Mengbi 的 。
GLM-5.3-Flash 可以关闭深度思考吗?
不能。官方模型页说明 thinking.type 只支持 enabled。推荐参数是 reasoning_effort: max、temperature: 1、top_p: 0.95 和 thinking.clear_thinking: false。
它真的达到 Claude Opus 4.8 水平了吗?
部分发布评测非常接近。官方图中,Terminal Bench 2.1 是 84.3 对 85.0,Z.ai 自研 Code Bench 在 max effort 下是 29.0 对 29.5。其他评测并不完全相同,归藏的视觉编程体验也不是受控实验。采购或迁移前,仍要拿两款模型跑相同任务和验收标准。
GLM-5.3-Flash 可以本地部署吗?
可以获得 MIT License 权重,官方列出了 vLLM、SGLang、TokenSpeed 和 KTransformers。模型总参数为 320B,本地部署仍然需要大量显存或内存、合适的量化方案和完整的服务工程准备。
来源与核验说明
本文的价格、模型和 API 信息在 2026 年 8 月 27 日核对了 、、、和。更完整的技术背景来自 。
三个视觉编程案例整理自。独立发布背景参考了 和。Mengbi 没有使用付费 API Key,也没有复现官方 benchmark 和归藏的前端任务。性能结论继续标注为 Z.ai 或原作者说法,限时价格则应在 9 月 9 日后重新检查。
最后核验:2026 年 8 月 27 日。
文中提到的 AI 工具
MENGBI
在做 AI 产品?欢迎聊聊。
想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。