能上手|Agent 质量别只靠体感:半天能搭的最小评测集
智讯实用·能上手··81/100
AIAI 导读
很多团队上线 Agent 后用「感觉还行」当验收。最小可行做法:固定 20–40 条真实任务、定义成功判据(格式 / 工具调用 / 人工偏好),每次改 prompt 或换模型只看三列数字。
为什么要做
Agent 一改 prompt 就「好像更好了」,三天后又说不清退步在哪。最小评测集的目标不是学术榜单,而是可重复对比。
半天版清单
- 从生产日志抽 20–40 条真实任务(脱敏)
- 每条写清:期望输出形态、是否允许工具调用、失败例子
- 跑两版(改前 / 改后),只记:可用率、人工偏好、平均耗时/成本
- 把结果贴进 PR,不贴感觉
注意
- 评测集要冻结:改题等于换尺子
- 高风险任务单独一栏,不要和内部草稿混算平均分