Gemini 3.8 Flash 发布:Google 正在把 Flash 变成 Agent 主力模型
Google 在 9 月 2 日正式发布 Gemini 3.8 Flash,稳定模型 ID 是 gemini-3.8-flash,Gemini API 已进入 GA。它不是一次上下文扩容:输入仍为 1,048,576 tokens,最大输出仍为 65,536 tokens。真正值得关注的是产品角色的变化——Google 不再只把 Flash 描述成便宜、快速的回答模型,而是把它推向长时程软件工程、自治 Agent 与复杂知识工作。
这也解释了 3.8 的核心矛盾:单价和 3.7 相同,生成吞吐更快,但它会执行更多推理、工具调用与自检,因此一次任务未必更便宜。
一张能力清单先看懂它
3.8 Flash 接受文本、图片、视频、音频和 PDF,最终只输出文本。它支持函数调用、结构化输出、代码执行、文件搜索、URL Context、Google Search 与 Maps grounding、上下文缓存,以及 Batch、Flex 和 Priority 推理。Computer Use 也能使用,但仍是 Preview。
边界同样清楚:它不能生成图片或音频,不支持 Live API,也没有开放微调。所谓“多模态”主要指理解多种输入,而不是一个模型包办视频、语音和图片创作。普通用户可在 Gemini app、Search AI Mode 和 Sheets 中接触它,但 Google 公告明确的是 Pro 与 Ultra 订阅层级;开发者则可以从 AI Studio 和 Gemini API 开始。
Flash 也会先想一会儿
模型提供 low、medium、high 三档 thinking,默认是 medium,不支持 minimal。low 适合聊天、分类与低延迟工具调用;medium 是大多数编码和 Agent 流程的起点;high 更适合困难推理和长任务,但会增加思考 token、工具轮次与首字等待。
Google 所说的“更勤奋”并不是免费能力。Artificial Analysis 在 high 档测得 3.8 的综合指数高于 3.7,稳态输出速度也更快,但首 token 更慢,平均任务成本约高四成。换句话说,它的优势更像“更愿意把任务做完”,而不是每个问题都瞬间给出更好的第一句话。
基准提升集中在执行型任务
Google 展示的最大进步出现在终端操作、跨文件软件工程、金融 Agent 和工具任务上;部分通用知识、多模态评测只小幅提高,普通 Humanity’s Last Exam 甚至略低于 3.7。厂商汇总的数字可以说明优化方向,却不能证明它全面击败所有大模型,因为不同模型可能使用不同 harness、推理档位和厂商自报结果。
独立评测也呈现相同的交换关系:能力得分提高的同时,3.8 会产生更多输出、执行更多 Agent 步骤。真实产品应该比较任务完成率、重试次数、工具费用、端到端时间和人工返工,而不是只盯每百万 token 的价格。
价格看似没变,账单可能变了
发布阶段的标准 API 价格为每百万输入 tokens 0.75 美元、输出 tokens 3.75 美元,输出价格包含 thinking tokens;官方公布的后续标准价会翻倍。Batch 与 Flex 更便宜,适合无需立即返回的批处理。免费层可以体验,但受配额和数据条款约束,不能理解成无限免费。
对于长文档和 Agent,应先做三件事:用缓存减少重复上下文;按任务难度路由 thinking;记录单次任务的输入、输出、工具调用和成功成本。高档推理若减少了重试,可能更划算;若只是让简单任务想得更久,就是浪费。
用 Python 开始
安装新版 SDK,并把 API key 放在环境变量中:
pip install -U google-genai
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Review this retry workflow and identify race conditions.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_level="medium"
)
),
)
print(response.text)
从 3.7 或 3.6 迁移时,不要只替换模型字符串。把旧的整数 thinking_budget 改成 thinking_level,并回归测试 JSON、函数参数、工具调用顺序、超时和成本。Google 还要求清理一批旧采样参数;在升级前应按开发者指南检查请求结构,而不是依赖后端静默兼容。
Cyber 版本不是普通开关
同日发布的 Gemini 3.8 Flash Cyber 与普通版本共享基础智能,但面向漏洞发现和自动修复,只通过 Fairwind Program 提供给受信任的政府机构、关键基础设施运营方和软件维护者。它采用更宽松的网络安全缓解策略,不能把相关成绩直接套到公开 API 型号上。
我的判断
3.8 Flash 最重要的信号,是 Google 正在把 Flash 从“高吞吐小模型”重塑为 Agent 执行层。它有稳定 API、完整工具栈和很低的入场单价,值得进入编码、检索和多步工作流的 A/B 测试,但还不该因一张排行榜直接替换生产模型。
模型卡仍承认幻觉、偶发慢响应和超时;高 effort 会消耗更多 tokens,多语言安全内部指标还有回退。最合理的采用方式,是让 3.7 与 3.8 在同一批真实任务上并行跑,比较成功成本和人工修复,再决定哪些任务交给 3.8。它不是便宜版 Pro,而是一匹跑得快、也更愿意多跑几步的 Agent 工作马。