English · 中文

全部标签

agent evaluation

1 篇相关文章

GPT-5.5 初看:面向真实工作的能力该怎样评估

Apr 27, 2026

在 GPT-5.5 API 发布后,以冻结任务、隐藏验收、工具轨迹、人工复核和完整任务成本评估真实工作能力。

大漠的头像

大漠

软件开发者

  • lukes.lu@yahoo.com
  • github.com/ilukes
  • @lupingui
  • 首页
  • 关于
  • 标签 →
    • SwiftUI
    • OpenAI
    • Responses API
    • cancellation
    • iOS 26 beta
    • reasoning effort
    • AI Agent
    • Codex

©2026 All rights reserved. Made with Jekyll and ♥