OpenAI 的模型页记录 GPT-5.5 快照 gpt-5.5-2026-04-23,API changelog 在 4 月 24 日记录可用性。官方将它定位于复杂专业工作、编程和工具型流程,但“更强”必须在自己的任务中定义。首发评测不应追求复述榜单,而应回答:它能否在限定权限下完成真实交付,并减少人类纠正的总成本。

把“真实工作”写成可验收任务

“写得更专业”无法稳定评分。一个工程任务可以定义:从固定提交开始,修复 issue,不修改公共 API,通过指定测试,无新增依赖,并提交简短解释。一个研究任务可以定义:只使用给定资料,回答五个问题,每个结论带引用,对无证据问题拒答。一个文档任务可以定义结构、读者、长度和禁止虚构内容。

每个 case 包含初始状态、可用工具、时间/token 上限、隐藏验收和风险等级。隐藏验收防止模型只迎合公开测试;同时保留人工 rubric,覆盖可维护性、证据和副作用。冻结仓库、数据和工具版本,使当前基线与 GPT-5.5 在同一环境比较。

模型快照与配置是结果的一部分

使用 alias 方便试验,生产评测则记录快照 gpt-5.5-2026-04-23、reasoning effort、verbosity、prompt、工具 schema、上下文策略和日期。一次只改变一个主要变量。若从旧模型迁移同时重写 prompt,至少建立模型-only 与 prompt+model 两个实验臂。

成本报告应保存实际账单规则、模型配置和评测日期,账户可用性与速率限制也按具体项目核对。这样以后仍能解释每次运行的成本,而不必把可变政策嵌入输出解析。

评分完整轨迹,而非最终文字

代理可能给出正确答案,却在过程中访问无关文件、调用多余工具或尝试越权。记录每个工具提案、验证、执行结果、重试、取消和最终输出。指标包括任务成功、隐藏测试、无关修改、无效工具参数、越权阻止、总延迟、输入输出 token、工具次数和人工复核分钟。

失败分类比平均分有用:检索遗漏、错误计划、实现缺陷、未运行验证、误判工具结果、无限循环或虚构完成。把“模型自行修复后成功”与“一次成功”分开;前者仍有价值,但成本和恢复能力不同。

Reasoning effort 按任务形成曲线

对简单分类和明确编辑测试 low/none,对复杂调试测试 medium/high,再为极少数困难异步任务评估 xhigh。相同 case 多次运行,画出成功率、延迟与成本曲线。最高 effort 不自动等于最佳产品点,默认配置也不一定适合所有任务。

如果高 effort 减少三轮返工,总任务成本可能更低;如果只是生成更长解释则应降低。交互任务还要看首个有用反馈,后台任务看整体完成与超时。不要用单次 token 数替代用户等待和人工时间。

安全评测必须与能力评测并行

加入工具结果中的提示注入、无权文件、删除请求、恶意 issue、重复提交和敏感数据。模型只能提出动作,确定性策略校验 allowlist、schema、账户和审批。成功抵抗一次攻击不是安全证明;报告越权尝试、阻止与误拒绝。

使用临时环境、测试账户和可恢复数据。代码任务限制工作区,网络与安装默认关闭。评测模型的能力不能以扩大权限为代价,否则不同模型比较也不公平。

人类盲评与生产影子流量

对主观产物做随机盲评,隐藏模型名称,多个评审使用同一 rubric。记录分歧并回到具体标准,不用“我更喜欢”作为唯一证据。离线通过后可在非关键影子流量中运行,不向用户展示或执行副作用,再比较真实输入分布。

上线门槛预先定义:哪些任务提升、哪些不能退化、成本与延迟上限、出现何种失败立即回退。模型 alias 漂移前重跑保留集。

结论

GPT-5.5 的首发价值不在一个综合分,而在完成闭环任务的分布。固定快照与 harness,评分工具轨迹、验证、成本和人工纠正,按任务选择 effort,并把安全攻击放进同一评测。只有在受限权限下持续交付可验证结果,官方能力定位才转化成产品证据。