Google Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 官方发布图。来源:。
Gemini 3.8 Flash API 已于 2026 年 9 月 2 日发布,稳定模型 ID 是 gemini-3.8-flash。它保留 1,048,576 token 输入上下文,支持文本、图片、视频、音频和 PDF 输入,也能使用函数调用、代码执行、搜索、URL Context、Computer Use 等工具。
这次更新的重点不是单项分数。Google 把 Gemini 3.8 Flash 定位为面向生产 Agent、编程和知识工作的低延迟模型,并让它在复杂任务里采取更短的推理步、更多轮工具调用。结果是长流程任务更容易推进,但困难请求也可能比 Gemini 3.7 Flash 生成更多 token。
价格同样需要看清时间范围。全球标准 API 在 2026 年 12 月 31 日前按输入每百万 token 0.75 美元、输出 3.75 美元计费;2027 年 1 月 1 日起,标准价变为输入 1.50 美元、输出 7.50 美元。下面把模型规格、官方 benchmark、UI 演示、调用方式和迁移风险分开说明。
Gemini 3.8 Flash API 关键信息
| 项目 | 官方信息 | 对接时要注意什么 |
|---|---|---|
| 发布时间 | 2026 年 9 月 2 日 | 本文核验于 2026 年 9 月 5 日 |
| 稳定模型 ID | gemini-3.8-flash | 不需要使用 preview 后缀 |
| 输入上下文 | 1,048,576 token | 长上下文不等于要把全部资料塞进一次请求 |
| 最大输出 | 65,536 token | Agent 仍需限制轮数、超时和总输出预算 |
| 输入类型 | 文本、图片、视频、音频、PDF | 输出仅为文本,不支持原生图片生成 |
| Thinking | low、medium、high | minimal 不受支持,会返回错误 |
| 主要工具 | Function Calling、代码执行、搜索与 Maps Grounding、URL Context、File Search、Computer Use Preview | 各工具的计费、区域和预览状态需单独确认 |
| API | Gemini API、Vertex AI、OpenAI 兼容接口 | OpenAI 兼容层仍标为 beta |
模型规格以 Google 的 为准。它可以理解视觉和音视频内容,但返回的是文本。如果工作流需要图片输出,仍要连接专门的图像模型。
1M 上下文适合大型代码库、长录音、视频和文档包。生产系统仍应保留检索、缓存和上下文裁剪,因为输入越长,首 token 延迟与账单越容易上升。对 Agent 来说,能容纳更多历史不是免去状态管理,而是给了编排器更大的选择空间。
Gemini 3.8 Flash 系列包括什么?
这次发布包含两个名称接近、开放范围不同的模型。
Gemini 3.8 Flash 是面向开发者和用户的通用模型。Google 已在 Gemini API、Google AI Studio、Vertex AI 和 Gemini Enterprise Agent Platform 提供它;Google AI Pro 和 Ultra 用户还能在 Gemini 应用、AI Mode 与 Google Sheets 中访问 3.8 Flash。
Gemini 3.8 Flash Cyber 面向网络防御。它通过 Google DeepMind 的 向获批的可信防御者提供受控访问,覆盖漏洞分析、事件响应和防御自动化。它不是一个可供所有开发者直接选择的公开 API 模型,获准组织还需遵守用途和再分发限制。
因此,普通产品接入应以 gemini-3.8-flash 为准。只有合格的网络安全团队,才需要评估 Fairwind 和 Flash Cyber 的申请条件。
Gemini 3.8 Flash API 价格
Google 当前公布的是全球标准 API 推广价。优惠结束后的价格已经一并列出,单位都是每百万 token。
| 计费项目 | 2026 年 12 月 31 日前 | 2027 年 1 月 1 日起 |
|---|---|---|
| 未缓存输入 | 0.75 美元 | 1.50 美元 |
| 缓存输入 | 0.075 美元 | 0.15 美元 |
| 输出 | 3.75 美元 | 7.50 美元 |
例如,一次任务使用 100 万未缓存输入 token,并生成 20 万输出 token。推广期模型费用约为 1.50 美元:输入 0.75 美元,输出 0.75 美元。常规标准价下,同样的 token 组合约为 3 美元。这个例子没有加入搜索、地图或其他工具费用。
异步任务可以考虑 。Google 将 Batch 定价设为标准价的 50%,目标完成时间为 24 小时内,实际常会更快。它适合离线评测、批量摘要和不要求即时响应的内容处理,不适合聊天和交互式 Agent。
价格表还有两个边界。第一,Vertex AI 的非全球区域、Priority 等服务档位可能不同,不能把全球 Standard 价格套到所有部署上。第二,3.8 Flash 在难题上可能比 3.7 Flash 使用更多输出 token。两款模型的每 token 单价可以相同,但最终账单仍可能不同。Google 在里明确提醒了这一点。
Gemini 3.8 Flash Benchmark 应该怎么看?
Google 的发布表把 Gemini 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5、GPT-5.6 Sol 等模型放在同一组 Agent、编程和专业任务评测中。3.8 Flash 在 DeepSWE v1.1 得到 73.7,3.7 Flash 是 65.3;在 GDPVal-AA v2 得到 1545;Terminal-Bench 2.1 得到 89.4;OSWorld 2.0 得到 59.0。
Google 官方发布表,保留原图的评测名称、脚注和对比模型。数字由各厂商或评测方在指定配置下生成,不是 Mengbi 独立复测。来源:。
这些成绩说明 3.8 Flash 进入了长流程 Agent 和编程模型的第一梯队,但不能简化成“每项都第一”。DeepSWE v1.1 中,Claude Opus 5 是 74.0,高于 3.8 Flash 的 73.7;不同测试也使用不同工具、提示和时间预算。发布表更适合用来筛选测试对象,不适合直接替代采购结论。
DeepSWE v1.1 评测聚焦真实软件工程任务。Gemini 3.8 Flash 为 73.7,接近图中最高分,但成绩仍受 Agent 框架和运行设置影响。来源:。
对团队更有用的做法,是固定 30 到 100 个真实任务,记录最终测试通过率、人工修正次数、工具调用轮数、总输入输出 token、超时和完整成本。高分模型如果反复探索或输出过长,在批量任务里未必更便宜。
Google 展示的四个 Gemini 3.8 Flash UI
Google 的发布文章放出了四段交互演示,覆盖游戏、地图、数据可视化和 3D 教学工具。它们能说明模型在 Antigravity 和 Google AI Studio 里可以处理连续的前端构建任务,但仍是官方挑选的展示片段,不是盲测或一次生成成功率。
Chronomancers:由循环指令推进的网页游戏
Chronomancers 在 Google Antigravity 中通过循环指令构建,纹理使用 Nano Banana 生成。截图取自 Google 官方演示视频。
Chronomancers 把状态面板、地图、战斗和视觉素材放进一个可玩的界面。它展示的重点不是一张漂亮截图,而是模型能围绕同一目标连续实现、运行和修正。对产品团队来说,这类案例应按“完成一个可玩的闭环”验收,而不是只比较首屏观感。
DOS Google Maps:复古界面里的真实地图交互
DOS Google Maps 在 Antigravity 中完成。截图同时保留代码、运行界面和 Agent 验证过程,来自 Google 官方演示视频。
这个项目把真实地图交互压进 DOS 风格窗口。演示里可以看到文件结构、任务进度、地图操作和验证反馈。它说明 3.8 Flash 能把视觉约束与功能约束放在同一轮开发流程里,但项目效果也依赖地图 API、浏览器工具和运行环境。
Topographic Map:实时地形剖面与投影
Topographic Map 使用 USGS 数据绘制实时横截面和投影。截图取自 Google 官方演示视频。
地形演示把三维场景、数据源、相机和剖面图联动起来。它更接近一个小型数据产品,而不是静态落地页。模型需要处理坐标、绘制状态和交互反馈,测试也应覆盖数据边界、缩放和低性能设备。
Hardware Anatomy:可拆解的 3D 结构教学工具
Hardware Anatomy 在 Google AI Studio 中使用 Three.js 构建,可通过 Deconstruct 滑杆拆解零件。截图来自 Google 官方演示视频。
Hardware Anatomy 让用户拖动滑杆查看零件分解。它把模型生成的 Three.js 场景变成一种教学交互。真正上线时还要补充键盘操作、替代文本、移动端控制和低性能降级,这些通常不会在短演示中完整呈现。
Gemini 3.8 Flash API 怎么调用?
先在 创建 API Key,把它保存在服务端环境变量 GEMINI_API_KEY 中。官方 Python SDK 包名是 google-genai。下面的基础请求没有加入工具或复杂配置,便于先确认鉴权、模型 ID 和返回格式。
genai.Client() 会读取 GEMINI_API_KEY。不要把 Key 放进浏览器 bundle、公开仓库或前端环境变量。服务端还需要记录请求 ID、token 用量、工具调用次数、延迟和停止原因,并为重试和 Agent 总轮数设上限。
使用 OpenAI Python SDK
Google 提供 OpenAI 兼容端点,适合已经使用 OpenAI SDK 的项目。兼容层仍是 beta;迁移前要用锁定版本的 SDK 跑回归测试。
reasoning_effort 可以使用 low、medium 或 high。不要同时通过兼容参数和原生 Gemini 参数设置同一项 Thinking 行为。完整请求格式见 。
要让 Agent 使用工具,还需要在客户端处理函数声明、工具结果和下一轮模型调用。单次文本请求成功,不代表长流程已经具备超时、幂等、工具权限和成本保护。
从 Gemini 3.7 Flash 迁移到 3.8
如果现有请求只传 model 和 contents,迁移可以先从替换模型 ID 开始。带采样、Thinking、多候选或工具回合的请求,需要按 逐项清理。
| 现有设置 | Gemini 3.8 Flash 的处理方式 |
|---|---|
gemini-3.7-flash | 改为 gemini-3.8-flash,保留 3.7 作为回滚组 |
temperature、top_p、top_k | 从迁移测试请求中移除,避免依赖旧采样行为 |
数字型 thinking_budget | 改为枚举 thinking_level |
thinking_level: minimal | 改为 low;3.8 不支持 minimal |
candidate_count | 移除;3.8 只支持一个候选 |
| 预填充的 model turn | 移除;3.8 不支持这种补全方式 |
| 多轮工具调用 | 保留 thought signature,并验证每轮消息结构 |
generateContent 函数结果 | 同时回传函数 call_id 和 name |
迁移时不要先把所有流量切过去。建议从 5% 到 10% 的影子请求或灰度流量开始,记录同一任务在 3.7 与 3.8 上的完成率、输出长度、工具错误和账单。确认回滚开关、超时和日志字段都可用后,再扩大比例。
还有一个容易误判的变化:3.8 的多轮 Agent 策略会倾向短步推进,困难任务可能产生更多工具回合。响应看起来更勤快,不代表效率更高。应比较完成一个业务结果的总成本,而不是只看单次响应延迟。
Gemini 3.8 Flash 和 3.7 Flash 怎么选?
| 场景 | 先试 3.8 Flash | 暂时保留 3.7 Flash |
|---|---|---|
| 长流程编程和 Agent | 需要更多轮工具使用与自我修正 | 现有流程已稳定,变更风险高 |
| 文档、音视频和多模态理解 | 需要 1M 上下文与同一套工具能力 | 任务短、输出结构简单 |
| 成本敏感批处理 | 愿意用 Batch 并测总 token | 3.7 已用较少 token 完成任务 |
| 低延迟交互 | 可以使用 low Thinking 并做实测 | 当前 P95 已达标,不想承担回归成本 |
| 生产迁移 | 有灰度、回滚和逐任务评测 | 还没有可靠的验收集与用量监控 |
Google 还没有给 Gemini 3.7 Flash 公布停用日期,仍把它列为受支持模型。因此,3.7 可以作为回滚和效率对照,不必为了追版本立即下线。
如果你正在选择承载模型的 IDE 或终端 Agent,可以先看 Mengbi 的 。如果任务横跨研究、表格和日常协作,更接近这次 3.8 Flash 的生产定位。
上线前如何测试 Gemini 3.8 Flash?
一套可复用的验收表,至少应记录以下字段:
- 任务是否完成,以及最终测试是否通过。
- 人工补充提示和手工修改的次数。
- 输入、缓存输入、输出 token 与完整费用。
- 工具调用总数、失败次数和重复调用次数。
- 首 token、完整响应和整项任务的 P50、P95 延迟。
- 超时、限流、空响应和结构化输出解析失败。
- 安全拒答、事实错误和带来源回答的可核验性。
测试集不要只放最顺利的案例。加入模糊需求、失效链接、超大文件、工具报错、重复函数结果和移动端截图。每个任务保留固定输入、验收脚本与人工评分规则,才能比较模型版本,而不是比较两次不同的提示词。
Google 的也列出幻觉、偶发变慢或超时、较高 Thinking 使用更多 token 等限制。安全评测并非每项都比 3.7 改善;涉及医疗、法律、金融、权限操作或网络安全的任务,仍需人工复核和系统级权限控制。
常见问题
Gemini 3.8 Flash 什么时候发布?
Google 在 2026 年 9 月 2 日发布 Gemini 3.8 Flash。开发者可以通过 Gemini API、Google AI Studio 和 Vertex AI 使用稳定模型 ID gemini-3.8-flash。
Gemini 3.8 Flash API 多少钱?
全球 Standard API 在 2026 年 12 月 31 日前的推广价是输入每百万 token 0.75 美元、缓存输入 0.075 美元、输出 3.75 美元。2027 年 1 月 1 日起,标准价分别为 1.50、0.15 和 7.50 美元。不同区域和服务档位可能不同。
Gemini 3.8 Flash 支持多长上下文?
最大输入上下文为 1,048,576 token,最大输出为 65,536 token。长上下文会增加延迟和费用,仍需检索、缓存与裁剪。
Gemini 3.8 Flash 能看图片和视频吗?
可以。模型支持文本、图片、视频、音频和 PDF 输入,输出为文本。它适合理解媒体内容,但不直接生成图片。
Gemini 3.8 Flash 支持 OpenAI SDK 吗?
支持。把 OpenAI 客户端的 Base URL 改为 Google 的 v1beta OpenAI 兼容端点,并使用 gemini-3.8-flash。这层兼容仍是 beta,上线前要验证流式输出、工具调用和错误格式。
Gemini 3.8 Flash Cyber 可以公开调用吗?
不能按普通公开 API 模型理解。Flash Cyber 通过 Fairwind 项目向获批的可信网络防御组织提供受控访问,申请和使用受额外规则约束。
是否应该立即从 Gemini 3.7 Flash 升级?
不必立即全量切换。3.8 更适合进入 Agent、编程和复杂多模态任务的测试组;3.7 仍受支持,也可能在短任务上使用更少 token。先灰度比较任务成功率、延迟和完整账单。
来源与核验说明
本文的模型规格、价格、迁移项和评测数字来自 Google 官方资料:
官方 UI 图片来自 Google 发布文章所附视频,本文只截取用于评论与说明的画面,并保留来源。Benchmark 为 Google 或其列出的评测方结果,Mengbi 没有使用付费 API Key 复测,也未接受 Google 赞助。价格、模型状态和预览功能可能变化,采购或生产接入前请复核官方页面。
最后核验:2026 年 9 月 5 日。

