English · 中文

RAG 优化前先做评测:检索、引用与拒答的最小基线

Mar 14, 2026

用小型确定性数据集拆开评估 RAG 的检索召回、答案引用、忠实性和拒答,不用单一 LLM judge 分数替代证据。

用 DeepSeek-OCR 2 构建可追踪的文档解析管线

Mar 3, 2026

围绕 DeepSeek-OCR 2 建立从原始文件、页面渲染、模型版本、结构解析到人工复核的可追踪文档管线。

Claude Sonnet 4.6 计算机使用教程:从安全边界开始

Feb 21, 2026

把 Sonnet 4.6 computer use 放进隔离环境,以域名与动作白名单、即时审批、提示注入防护和可重放审计作为起点。

Claude Opus 4.6 的长上下文与代理编程:值得关注什么

Feb 10, 2026

在 Claude Opus 4.6 发布后,区分官方长上下文与代理能力声明,并用检索、修改、验证和成本评测决定真实价值。

Mistral Vibe 2.0:可定制子代理是否让终端编程更可靠

Jan 31, 2026

在 Vibe 2.0 发布后,从子代理边界、澄清、技能、权限与可复现实验判断终端编程可靠性,而不是只看功能数量。

  • « 上一页
  • 第 6 / 13 页
  • 下一页 »
大漠的头像

大漠

软件开发者

  • lukes.lu@yahoo.com
  • github.com/ilukes
  • @lupingui
  • 首页
  • 关于
  • 标签 →
    • SwiftUI
    • OpenAI
    • Responses API
    • cancellation
    • iOS 26 beta
    • reasoning effort
    • AI Agent
    • Codex

©2026 All rights reserved. Made with Jekyll and ♥