你们团队怎么给 Agent 写验收用例?
上线前我们一直卡在同一件事:Agent「感觉还行」,但一到真实账号、真实工具、真实超时,就会出现偶发翻车。团队想建立一套可重复的智能体验验收流程,而不是靠演示日手感——否则上线后客服和值班会被同一类失败反复打爆。
先说我们现在的粗框架,欢迎拍砖:
1. 意图层:固定 prompt 集,覆盖主路径与易混意图,记录命中率与澄清次数; 2. 工具层:对每个 connector 建成功 / 超时 / 权限不足三类样例,要求可重试且有可读错误; 3. 任务层:端到端任务完成率 + 人工接手次数 / 周,作为「真的省时间」的业务指标; 4. 负例层:单独维护「应拒绝 / 应转人工 / 幻觉风险」集合,避免只刷正例好看。
工具链上我们试过 Promptfoo + 表格人工 spot-check + 夜间 CI。还差的是:多 Agent 协作时「谁该先动手」怎么判定?费用与延迟预算门禁有没有公认阈值?版本对比时,除了通过率,你们还会看轨迹里的哪几段证据?
如果你们已经有清单、模板或踩坑故事,请直接贴在楼下(可打码)。也欢迎来 Vertex Kit / 相关产品页对照一下你们的评测集结构——我们更想收集可复用的验收资产,而不是口号。优质回复我们会整理成社区可引用的最小用例集。
你怎么看?
1,304 次浏览
暂无人在线添加评论
