GPT-5.6 Sol、Terra 与 Luna:新分层该怎样选
OpenAI 在 2026 年 7 月 9 日发布 GPT‑5.6 Sol、Terra 与 Luna。gpt-5.6 alias 在当时指向 Sol:Sol 面向前沿能力,Terra 在能力与成本间取平衡,Luna 面向高吞吐和成本敏感任务。这个命名比“旗舰、mini、nano”更容易让人误以为三档可以按预算直接替换;实际选择仍需用同一任务集验证。
不按模型名路由
先按任务风险划分:格式转换、标签建议和候选召回通常可以从 Luna 开始;带多步工具、长文档和较复杂代码修改的任务从 Terra 开始;高价值决策支持、困难调试或评测证明需要更强能力的工作再考虑 Sol。这个起点不是结论。
路由器不应读取“复杂”“重要”等用户自述就升级模型。使用可观察特征,例如输入长度、工具数量、领域风险、失败后的人工成本和服务级别。涉及外部副作用时,模型档位不会改变审批要求。
推理级别是第二个维度
GPT‑5.6 支持从 none 到 max 的多个 reasoning effort。模型档位与推理强度应分开评测:Terra 的较高 effort 可能适合某些任务,Sol 的较低 effort 也可能更快满足需求。不要默认“最贵模型 + max”必然是最佳生产配置。
从现有 GPT‑5.5 配置迁移时,官方建议保留当前 effort 作为基线,并比较低一级。每个配置记录模型 id、effort、prompt 版本、工具版本和评测日期。移动 alias 适合持续候选测试,受控发布应保存当时实际解析结果。
新能力需要独立验收
首发记录包括 programmatic tool calling、显式 prompt caching、persisted reasoning、max effort、Pro mode 与 beta 多 Agent。它们不是必须同时启用的套餐。先保持现有工具循环,只换模型建立基线,再一次增加一个能力。
Programmatic tool calling 适合在受控运行时中批量过滤或汇总中间工具结果,不适合需要逐步人工判断的高风险动作。多 Agent 能降低可并行任务的墙钟时间,也会增加合并冲突、成本和追踪复杂度。Pro mode 需要用明确的质量收益证明其额外计算值得。
一张可执行的评测矩阵
为每个真实任务保存输入、允许工具、期望事实、拒答条件和评分器。三档模型在相同 prompt、工具 schema、预算与数据快照上运行;再对有潜力的档位测试相邻 effort。指标包括任务成功、事实错误、无效工具调用、审批违规、token、延迟和估算成本。
把质量门槛写成约束:例如字段提取必须达到既定正确率且越权调用为零,然后在合格配置中选择成本和延迟更低者。平均分不能掩盖高风险尾部案例;对付款、权限和隐私任务单独报告最坏失败。
fallback 不能扩大权限
低档模型失败后可以升级,但要携带同一任务 id 与已验证事实,避免重复副作用。fallback 只改变推理资源,不增加工具、数据范围或授权。连续升级仍失败时转人工,并保存每次尝试以便定位问题。
GPT‑5.6 的三层命名提供了更细的成本与能力选择,真正的价值取决于路由是否可解释、评测是否冻结、权限是否稳定。我的建议是 Luna 优先筛选、Terra 作为多数 Agent 工作的候选起点、Sol 留给测得的困难任务;最终边界应由你的数据证明,而不是由型号替你决定。