Gemini 3.5 Flash 已通过 Gemini API 等入口正式提供;同一公告仍将 3.5 Pro 描述为后续型号,不能当作已发布的同级模型。比“Flash 是否接近旗舰模型”更值得开发者关注的变化,是模型与托管 Agent 运行时开始被作为一个整体交付:模型负责提出步骤,运行时保存状态、调度工具、限制资源并记录结果。

托管的不是业务责任

自建循环通常要处理任务队列、重试、超时、会话状态、凭据和日志。托管运行时可以减少这些基础设施工作,却不会替应用决定退款能否执行、哪些文件可以读取、何时必须由人确认。供应商提供执行容器,产品仍然拥有授权、事实和最终副作用。

因此,第一张设计表不应列“模型能力”,而应列动作风险:只读查询可自动执行;创建草稿可自动但需记录;发送邮件、提交交易、删除数据或修改权限必须在参数确定后请求批准。批准的是一次具体调用,不是模糊的整段计划。

把 Agent 看成有界状态机

一个可靠任务至少包含 queuedplanningwaiting_approvalrunning_toolcompletedfailedcancelled。每次转换都记录任务 id、模型版本、工具名、参数摘要、调用 id 与时间。运行时重启后,应用先核对外部动作是否已经成功,再决定是否重试,避免重复发送或重复扣款。

给循环设定三类预算:最大步骤数、总运行时间和成本上限。连续两次以相同参数调用同一失败工具时停止;遇到权限拒绝不自动扩大范围;缺少必要信息时回到用户,而不是让模型猜测。托管不等于无限运行。

工具 Schema 只是入口

Gemini 的函数调用可以让模型生成结构化参数,但 schema 合法不代表动作被授权。网关需要重新验证类型、账户归属、目标 allowlist 和业务规则。凭据留在执行器中,模型只看到窄工具,例如 read_invoice(invoice_id),而不是任意 URL、SQL 或 shell。

工具结果也属于不可信输入。网页、工单和文档可能包含提示注入;把其内容标记为数据,不允许结果文本增加工具、改变系统规则或跳过审批。返回最少字段,敏感值在日志中脱敏。

Managed Agents 真正改善什么

它最有价值的地方是把长任务需要的持久状态、工具连接、并行步骤和观测能力做成可复用平台。团队可以更快获得统一 trace,并在任务失败时定位是模型决策、工具错误、配额还是审批等待。不过便利也会形成平台耦合:状态格式、事件流、内建工具和身份模型可能无法原样迁移。

在领域层保存自己的 TaskToolCallApproval 记录。供应商 adapter 只负责把这些对象映射到 Gemini 运行时。这样即使切换模型或改成自建队列,审计历史和业务规则仍然可读。

评测要覆盖整条轨迹

不要只评分最终回答。固定一组任务,检查是否选择正确工具、参数是否有证据、是否在高风险动作前停下、工具失败后是否合理恢复、取消是否生效,以及最终状态是否与外部系统一致。记录成功率、无效调用、重复副作用、人工接管率、延迟与成本。

Gemini 3.5 Flash 的官方榜单可以作为候选信号,不能代替本地评测。真正的问题是:在你的权限模型、工具延迟和失败分布下,完整任务是否更可靠。托管代理降低的是编排门槛,不是治理要求;越容易让 Agent 行动,越要把审批、幂等与追踪放在模型之外。