约 7 分钟阅读

Gemini 3.8 Flash API 值得升级吗?价格、评测与迁移要点

Gemini 3.8 Flash API 值得升级吗?价格、评测与迁移要点

TL;DR

Gemini 3.8 Flash API 已于 2026 年 9 月 2 日发布,稳定模型 ID 为 gemini-3.8-flash。它支持 1,048,576 token 输入上下文、文本与多模态输入、工具调用和三级 Thinking;全球标准 API 推广价为输入每百万 token 0.75 美元、输出 3.75 美元,有效至 2026 年 12 月 31 日。Google 报告的 Agent 和编程成绩有竞争力,但 3.8 在复杂任务上可能比 3.7 使用更多 token,上线前应按任务成功率和总账单一起测试。

Google Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 官方发布图。来源:

Gemini 3.8 Flash API 已于 2026 年 9 月 2 日发布,稳定模型 ID 是 gemini-3.8-flash。它保留 1,048,576 token 输入上下文,支持文本、图片、视频、音频和 PDF 输入,也能使用函数调用、代码执行、搜索、URL Context、Computer Use 等工具。

这次更新的重点不是单项分数。Google 把 Gemini 3.8 Flash 定位为面向生产 Agent、编程和知识工作的低延迟模型,并让它在复杂任务里采取更短的推理步、更多轮工具调用。结果是长流程任务更容易推进,但困难请求也可能比 Gemini 3.7 Flash 生成更多 token。

价格同样需要看清时间范围。全球标准 API 在 2026 年 12 月 31 日前按输入每百万 token 0.75 美元、输出 3.75 美元计费;2027 年 1 月 1 日起,标准价变为输入 1.50 美元、输出 7.50 美元。下面把模型规格、官方 benchmark、UI 演示、调用方式和迁移风险分开说明。

Gemini 3.8 Flash API 关键信息

项目官方信息对接时要注意什么
发布时间2026 年 9 月 2 日本文核验于 2026 年 9 月 5 日
稳定模型 IDgemini-3.8-flash不需要使用 preview 后缀
输入上下文1,048,576 token长上下文不等于要把全部资料塞进一次请求
最大输出65,536 tokenAgent 仍需限制轮数、超时和总输出预算
输入类型文本、图片、视频、音频、PDF输出仅为文本,不支持原生图片生成
Thinkinglowmediumhighminimal 不受支持,会返回错误
主要工具Function Calling、代码执行、搜索与 Maps Grounding、URL Context、File Search、Computer Use Preview各工具的计费、区域和预览状态需单独确认
APIGemini API、Vertex AI、OpenAI 兼容接口OpenAI 兼容层仍标为 beta

模型规格以 Google 的 为准。它可以理解视觉和音视频内容,但返回的是文本。如果工作流需要图片输出,仍要连接专门的图像模型。

1M 上下文适合大型代码库、长录音、视频和文档包。生产系统仍应保留检索、缓存和上下文裁剪,因为输入越长,首 token 延迟与账单越容易上升。对 Agent 来说,能容纳更多历史不是免去状态管理,而是给了编排器更大的选择空间。

Gemini 3.8 Flash 系列包括什么?

这次发布包含两个名称接近、开放范围不同的模型。

Gemini 3.8 Flash 是面向开发者和用户的通用模型。Google 已在 Gemini API、Google AI Studio、Vertex AI 和 Gemini Enterprise Agent Platform 提供它;Google AI Pro 和 Ultra 用户还能在 Gemini 应用、AI Mode 与 Google Sheets 中访问 3.8 Flash。

Gemini 3.8 Flash Cyber 面向网络防御。它通过 Google DeepMind 的 向获批的可信防御者提供受控访问,覆盖漏洞分析、事件响应和防御自动化。它不是一个可供所有开发者直接选择的公开 API 模型,获准组织还需遵守用途和再分发限制。

因此,普通产品接入应以 gemini-3.8-flash 为准。只有合格的网络安全团队,才需要评估 Fairwind 和 Flash Cyber 的申请条件。

Gemini 3.8 Flash API 价格

Google 当前公布的是全球标准 API 推广价。优惠结束后的价格已经一并列出,单位都是每百万 token。

计费项目2026 年 12 月 31 日前2027 年 1 月 1 日起
未缓存输入0.75 美元1.50 美元
缓存输入0.075 美元0.15 美元
输出3.75 美元7.50 美元

例如,一次任务使用 100 万未缓存输入 token,并生成 20 万输出 token。推广期模型费用约为 1.50 美元:输入 0.75 美元,输出 0.75 美元。常规标准价下,同样的 token 组合约为 3 美元。这个例子没有加入搜索、地图或其他工具费用。

异步任务可以考虑 。Google 将 Batch 定价设为标准价的 50%,目标完成时间为 24 小时内,实际常会更快。它适合离线评测、批量摘要和不要求即时响应的内容处理,不适合聊天和交互式 Agent。

价格表还有两个边界。第一,Vertex AI 的非全球区域、Priority 等服务档位可能不同,不能把全球 Standard 价格套到所有部署上。第二,3.8 Flash 在难题上可能比 3.7 Flash 使用更多输出 token。两款模型的每 token 单价可以相同,但最终账单仍可能不同。Google 在里明确提醒了这一点。

Gemini 3.8 Flash Benchmark 应该怎么看?

Google 的发布表把 Gemini 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5、GPT-5.6 Sol 等模型放在同一组 Agent、编程和专业任务评测中。3.8 Flash 在 DeepSWE v1.1 得到 73.7,3.7 Flash 是 65.3;在 GDPVal-AA v2 得到 1545;Terminal-Bench 2.1 得到 89.4;OSWorld 2.0 得到 59.0。

Google 发布的 Gemini 3.8 Flash 价格、编程、Agent、知识和多模态评测总表 Google 官方发布表,保留原图的评测名称、脚注和对比模型。数字由各厂商或评测方在指定配置下生成,不是 Mengbi 独立复测。来源:

这些成绩说明 3.8 Flash 进入了长流程 Agent 和编程模型的第一梯队,但不能简化成“每项都第一”。DeepSWE v1.1 中,Claude Opus 5 是 74.0,高于 3.8 Flash 的 73.7;不同测试也使用不同工具、提示和时间预算。发布表更适合用来筛选测试对象,不适合直接替代采购结论。

Gemini 3.8 Flash 与其他模型在 DeepSWE v1.1 上的官方柱状图 DeepSWE v1.1 评测聚焦真实软件工程任务。Gemini 3.8 Flash 为 73.7,接近图中最高分,但成绩仍受 Agent 框架和运行设置影响。来源:

对团队更有用的做法,是固定 30 到 100 个真实任务,记录最终测试通过率、人工修正次数、工具调用轮数、总输入输出 token、超时和完整成本。高分模型如果反复探索或输出过长,在批量任务里未必更便宜。

Google 展示的四个 Gemini 3.8 Flash UI

Google 的发布文章放出了四段交互演示,覆盖游戏、地图、数据可视化和 3D 教学工具。它们能说明模型在 Antigravity 和 Google AI Studio 里可以处理连续的前端构建任务,但仍是官方挑选的展示片段,不是盲测或一次生成成功率。

Chronomancers:由循环指令推进的网页游戏

Chronomancers 官方演示中的立体城堡、角色状态和回合制战斗界面 Chronomancers 在 Google Antigravity 中通过循环指令构建,纹理使用 Nano Banana 生成。截图取自 Google 官方演示视频。

Chronomancers 把状态面板、地图、战斗和视觉素材放进一个可玩的界面。它展示的重点不是一张漂亮截图,而是模型能围绕同一目标连续实现、运行和修正。对产品团队来说,这类案例应按“完成一个可玩的闭环”验收,而不是只比较首屏观感。

DOS Google Maps:复古界面里的真实地图交互

Google 官方 DOS Maps 演示中的代码编辑器、地图窗口和 Gemini Agent 验证结果 DOS Google Maps 在 Antigravity 中完成。截图同时保留代码、运行界面和 Agent 验证过程,来自 Google 官方演示视频。

这个项目把真实地图交互压进 DOS 风格窗口。演示里可以看到文件结构、任务进度、地图操作和验证反馈。它说明 3.8 Flash 能把视觉约束与功能约束放在同一轮开发流程里,但项目效果也依赖地图 API、浏览器工具和运行环境。

Topographic Map:实时地形剖面与投影

Google 官方 Topographic Map 演示中的三维地形、剖面图和控制面板 Topographic Map 使用 USGS 数据绘制实时横截面和投影。截图取自 Google 官方演示视频。

地形演示把三维场景、数据源、相机和剖面图联动起来。它更接近一个小型数据产品,而不是静态落地页。模型需要处理坐标、绘制状态和交互反馈,测试也应覆盖数据边界、缩放和低性能设备。

Hardware Anatomy:可拆解的 3D 结构教学工具

Google AI Studio 中 Hardware Anatomy 的机械键轴爆炸图与 Deconstruct 滑杆 Hardware Anatomy 在 Google AI Studio 中使用 Three.js 构建,可通过 Deconstruct 滑杆拆解零件。截图来自 Google 官方演示视频。

Hardware Anatomy 让用户拖动滑杆查看零件分解。它把模型生成的 Three.js 场景变成一种教学交互。真正上线时还要补充键盘操作、替代文本、移动端控制和低性能降级,这些通常不会在短演示中完整呈现。

Gemini 3.8 Flash API 怎么调用?

先在 创建 API Key,把它保存在服务端环境变量 GEMINI_API_KEY 中。官方 Python SDK 包名是 google-genai。下面的基础请求没有加入工具或复杂配置,便于先确认鉴权、模型 ID 和返回格式。

bash
pip install -U google-genai
python
from google import genai
client = genai.Client()
response = client.models.generate_content(    model="gemini-3.8-flash",    contents="Review this deployment plan and return the three highest-risk assumptions.",)
print(response.text)

genai.Client() 会读取 GEMINI_API_KEY。不要把 Key 放进浏览器 bundle、公开仓库或前端环境变量。服务端还需要记录请求 ID、token 用量、工具调用次数、延迟和停止原因,并为重试和 Agent 总轮数设上限。

使用 OpenAI Python SDK

Google 提供 OpenAI 兼容端点,适合已经使用 OpenAI SDK 的项目。兼容层仍是 beta;迁移前要用锁定版本的 SDK 跑回归测试。

python
import os
from openai import OpenAI
gemini_openai_host = "generativelanguage.googleapis.com"
client = OpenAI(    api_key=os.environ["GEMINI_API_KEY"],    base_url=f"https://{gemini_openai_host}/v1beta/openai/",)
response = client.chat.completions.create(    model="gemini-3.8-flash",    reasoning_effort="medium",    messages=[        {            "role": "user",            "content": "Create a testable migration checklist for this API change.",        }    ],)
print(response.choices[0].message.content)print(response.usage)

reasoning_effort 可以使用 lowmediumhigh。不要同时通过兼容参数和原生 Gemini 参数设置同一项 Thinking 行为。完整请求格式见

要让 Agent 使用工具,还需要在客户端处理函数声明、工具结果和下一轮模型调用。单次文本请求成功,不代表长流程已经具备超时、幂等、工具权限和成本保护。

从 Gemini 3.7 Flash 迁移到 3.8

如果现有请求只传 modelcontents,迁移可以先从替换模型 ID 开始。带采样、Thinking、多候选或工具回合的请求,需要按 逐项清理。

现有设置Gemini 3.8 Flash 的处理方式
gemini-3.7-flash改为 gemini-3.8-flash,保留 3.7 作为回滚组
temperaturetop_ptop_k从迁移测试请求中移除,避免依赖旧采样行为
数字型 thinking_budget改为枚举 thinking_level
thinking_level: minimal改为 low;3.8 不支持 minimal
candidate_count移除;3.8 只支持一个候选
预填充的 model turn移除;3.8 不支持这种补全方式
多轮工具调用保留 thought signature,并验证每轮消息结构
generateContent 函数结果同时回传函数 call_idname

迁移时不要先把所有流量切过去。建议从 5% 到 10% 的影子请求或灰度流量开始,记录同一任务在 3.7 与 3.8 上的完成率、输出长度、工具错误和账单。确认回滚开关、超时和日志字段都可用后,再扩大比例。

还有一个容易误判的变化:3.8 的多轮 Agent 策略会倾向短步推进,困难任务可能产生更多工具回合。响应看起来更勤快,不代表效率更高。应比较完成一个业务结果的总成本,而不是只看单次响应延迟。

Gemini 3.8 Flash 和 3.7 Flash 怎么选?

场景先试 3.8 Flash暂时保留 3.7 Flash
长流程编程和 Agent需要更多轮工具使用与自我修正现有流程已稳定,变更风险高
文档、音视频和多模态理解需要 1M 上下文与同一套工具能力任务短、输出结构简单
成本敏感批处理愿意用 Batch 并测总 token3.7 已用较少 token 完成任务
低延迟交互可以使用 low Thinking 并做实测当前 P95 已达标,不想承担回归成本
生产迁移有灰度、回滚和逐任务评测还没有可靠的验收集与用量监控

Google 还没有给 Gemini 3.7 Flash 公布停用日期,仍把它列为受支持模型。因此,3.7 可以作为回滚和效率对照,不必为了追版本立即下线。

如果你正在选择承载模型的 IDE 或终端 Agent,可以先看 Mengbi 的 。如果任务横跨研究、表格和日常协作,更接近这次 3.8 Flash 的生产定位。

上线前如何测试 Gemini 3.8 Flash?

一套可复用的验收表,至少应记录以下字段:

  1. 任务是否完成,以及最终测试是否通过。
  2. 人工补充提示和手工修改的次数。
  3. 输入、缓存输入、输出 token 与完整费用。
  4. 工具调用总数、失败次数和重复调用次数。
  5. 首 token、完整响应和整项任务的 P50、P95 延迟。
  6. 超时、限流、空响应和结构化输出解析失败。
  7. 安全拒答、事实错误和带来源回答的可核验性。

测试集不要只放最顺利的案例。加入模糊需求、失效链接、超大文件、工具报错、重复函数结果和移动端截图。每个任务保留固定输入、验收脚本与人工评分规则,才能比较模型版本,而不是比较两次不同的提示词。

Google 的也列出幻觉、偶发变慢或超时、较高 Thinking 使用更多 token 等限制。安全评测并非每项都比 3.7 改善;涉及医疗、法律、金融、权限操作或网络安全的任务,仍需人工复核和系统级权限控制。

常见问题

Gemini 3.8 Flash 什么时候发布?

Google 在 2026 年 9 月 2 日发布 Gemini 3.8 Flash。开发者可以通过 Gemini API、Google AI Studio 和 Vertex AI 使用稳定模型 ID gemini-3.8-flash

Gemini 3.8 Flash API 多少钱?

全球 Standard API 在 2026 年 12 月 31 日前的推广价是输入每百万 token 0.75 美元、缓存输入 0.075 美元、输出 3.75 美元。2027 年 1 月 1 日起,标准价分别为 1.50、0.15 和 7.50 美元。不同区域和服务档位可能不同。

Gemini 3.8 Flash 支持多长上下文?

最大输入上下文为 1,048,576 token,最大输出为 65,536 token。长上下文会增加延迟和费用,仍需检索、缓存与裁剪。

Gemini 3.8 Flash 能看图片和视频吗?

可以。模型支持文本、图片、视频、音频和 PDF 输入,输出为文本。它适合理解媒体内容,但不直接生成图片。

Gemini 3.8 Flash 支持 OpenAI SDK 吗?

支持。把 OpenAI 客户端的 Base URL 改为 Google 的 v1beta OpenAI 兼容端点,并使用 gemini-3.8-flash。这层兼容仍是 beta,上线前要验证流式输出、工具调用和错误格式。

Gemini 3.8 Flash Cyber 可以公开调用吗?

不能按普通公开 API 模型理解。Flash Cyber 通过 Fairwind 项目向获批的可信网络防御组织提供受控访问,申请和使用受额外规则约束。

是否应该立即从 Gemini 3.7 Flash 升级?

不必立即全量切换。3.8 更适合进入 Agent、编程和复杂多模态任务的测试组;3.7 仍受支持,也可能在短任务上使用更少 token。先灰度比较任务成功率、延迟和完整账单。

来源与核验说明

本文的模型规格、价格、迁移项和评测数字来自 Google 官方资料:

官方 UI 图片来自 Google 发布文章所附视频,本文只截取用于评论与说明的画面,并保留来源。Benchmark 为 Google 或其列出的评测方结果,Mengbi 没有使用付费 API Key 复测,也未接受 Google 赞助。价格、模型状态和预览功能可能变化,采购或生产接入前请复核官方页面。

最后核验:2026 年 9 月 5 日。

文中提到的 AI 工具

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。