智讯精选

能上手|Agent 质量别只靠体感:半天能搭的最小评测集

智讯实用·能上手··81/100
AIAI 导读

很多团队上线 Agent 后用「感觉还行」当验收。最小可行做法:固定 20–40 条真实任务、定义成功判据(格式 / 工具调用 / 人工偏好),每次改 prompt 或换模型只看三列数字。

为什么要做

Agent 一改 prompt 就「好像更好了」,三天后又说不清退步在哪。最小评测集的目标不是学术榜单,而是可重复对比

半天版清单

  1. 从生产日志抽 20–40 条真实任务(脱敏)
  2. 每条写清:期望输出形态、是否允许工具调用、失败例子
  3. 跑两版(改前 / 改后),只记:可用率、人工偏好、平均耗时/成本
  4. 把结果贴进 PR,不贴感觉

注意

  • 评测集要冻结:改题等于换尺子
  • 高风险任务单独一栏,不要和内部草稿混算平均分