智能体好不好用别靠感觉,一套测试集让它持续变强

2026-08-16 20:27:18 46 AI智能编辑DB 智能体 AI 干货 效率工具

先说结果
智能体评估 = 准确率+完成率+一致性+用户满意度,用测试集量化,不靠感觉。建立评估集→自动跑测→指标看板→迭代优化,闭环提升。

智能体好不好用别靠感觉,一套测试集让它持续变强

很多人搭完智能体就完事了——上线、用着、出了问题改一改、再出问题再改。从来没有系统评估过它到底好不好用,哪里好、哪里差、该往哪个方向优化。
凭感觉迭代的智能体,永远在"修了东墙补西墙"的循环里。今天改了提示词解决了 A 问题,明天发现 B 问题又冒出来了。
真正专业的做法是:用测试集量化评估,用数据驱动迭代。今天讲智能体的效果评估体系,看完你也能让自己的智能体持续变强。

为什么需要评估?智能体不是上线就完事

智能体和传统软件不一样。传统软件写好代码测试通过就稳定了,智能体的输出是概率性的——同一个问题,这次答对了下次可能答错。而且用户的需求在变、知识库在更新、模型在升级,任何一个变化都可能影响效果。
没有评估体系,你会遇到三个问题:
不知道好不好:用户说"还行",到底是 80 分还是 60 分?哪些场景好、哪些场景差?全凭感觉。
改完不知道有没有变好:改了一版提示词,感觉好像好了,但又说不上来哪里好了。可能 A 场景提升了,B 场景反而下降了。
问题发现太晚:等用户投诉才发现智能体在某个场景下一直在答错,可能已经影响了很多客户。
评估体系就是智能体的"体检报告"——定期检查、量化指标、发现问题、针对性优化。

评估三件套:测试集 + 指标 + 反馈闭环

测试集(Test Set):一组标准化的测试用例,每条包含输入和期望输出。用来反复测试智能体,看它能不能稳定给出正确答案。测试集是评估的基础,没有测试集一切都是空谈。
评估指标(Metrics):量化智能体表现的数字。准确率、完成率、幻觉率、响应时间……不同的智能体关注不同的指标,但至少要有 2-3 个核心指标。
反馈闭环(Feedback Loop):评估发现问题 → 定位原因 → 优化(改提示词/补知识库/加护栏)→ 用测试集回归测试 → 确认提升。这是一个持续循环,不是一次性的。

测试集怎么建?至少 50 条,覆盖三类场景

测试集的质量决定评估的可信度。一个好的测试集要覆盖三类场景:
典型场景(占 60%):用户最常问的问题、最常用的功能。从真实用户对话中提取,确保测试集反映真实使用情况。比如客服智能体,典型场景就是"查订单""退换货""产品咨询"。
边界 case(占 25%):容易出错的边缘情况。比如输入为空、问题模糊、超长文本、多语言混合、特殊字符。边界 case 是发现智能体短板的关键。
对抗样本(占 15%):故意设计的"难题",测试智能体的鲁棒性。比如 Prompt Injection 尝试、诱导越权的请求、包含误导信息的问题。对抗样本能帮你发现安全漏洞和逻辑缺陷。
每条测试用例要包含:输入(用户会说什么)、期望输出(正确答案应该包含什么关键点)、场景标签(属于哪类场景,方便分类统计)。期望输出不需要逐字一致,列出关键点即可——比如"必须提到 7 天无理由退货""不能给出具体诊断"。
数量上,至少 50 条起步,100 条以上比较可靠。太少了评估结果不稳定,可能刚好赶上智能体状态好/不好。

五个核心指标,量化智能体表现

① 准确率(Accuracy):测试集中答对的比例。最核心的指标,但要注意"答对"的定义——是完全匹配期望输出,还是包含关键点即可?建议用关键点匹配,更合理。
② 完成率(Completion Rate):智能体能完整完成任务的比例。比如订票智能体,10 次请求有 8 次成功订到票,完成率就是 80%。准确率看"答得对不对",完成率看"事能不能办成"。
③ 幻觉率(Hallucination Rate):输出中包含虚假信息、编造事实的比例。这是智能体最危险的问题——一本正经地胡说八道。知识库类智能体尤其要关注这个指标,幻觉率高于 5% 就不能上线。
④ 用户满意度(User Satisfaction):真实用户的反馈评分。可以在对话结束后加个"这次回答有用吗?👍/👎"的简单反馈,收集真实满意度。这是最有价值的指标,因为它反映了真实体验。
⑤ 响应时间(Latency):从用户提问到智能体给出答案的时间。超过 5 秒用户就会觉得慢,超过 10 秒流失率急剧上升。响应时间和准确率往往是 trade-off——要质量就得慢,要快就得牺牲质量,找到平衡点。
不用五个指标都盯,选 2-3 个和你的智能体最相关的核心指标。客服智能体重点看准确率和幻觉率,任务型智能体重点看完成率和响应时间。

迭代闭环:发现问题→定位→优化→回归

评估不是目的,迭代才是。一个完整的迭代闭环四步走:
第一步:跑测试集,发现 bad case。每周或每次改完提示词后,用测试集跑一遍,找出答错的用例。按场景分类统计,看哪个场景准确率最低,就是优化重点。
第二步:定位原因。bad case 不是都一样的,要分析根因:是提示词没写清楚?还是知识库缺资料?还是护栏太松/太紧?还是模型本身能力不够?不同原因对应不同优化手段。
第三步:针对性优化。提示词问题→改四件套(角色/任务/约束/格式);知识库问题→补资料/调切片;护栏问题→加约束/加人工确认;模型问题→换更强的模型或用专家模式。一次只改一个变量,方便定位效果。
第四步:回归测试。改完之后,用完整测试集重新跑一遍,确认目标场景提升了,且其他场景没有下降。只测改的那几条是自欺欺人——很可能修了 A 坏了 B。
这个闭环每周跑一次,一个月后你会发现智能体的准确率从 60% 爬到 85%+,而且是稳定的提升,不是忽上忽下。

实战:用 20 条测试集迭代客服智能体

用客服智能体做完整演示:
建测试集:从过去一个月的真实客服对话中提取 20 条高频问题,每条标注期望答案的关键点。比如"退货政策"→ 期望包含"7天无理由""退货运费买家承担""特价商品不退"。
首次评估:用测试集跑一遍,准确率 65%。发现三类问题:退货政策答错 3 条(知识库缺最新政策)、产品参数幻觉 2 条(模型编造参数)、答非所问 2 条(提示词角色太泛)。
第一轮优化:① 知识库补充最新退货政策文档;② 提示词约束"产品参数必须来自知识库,不确定就说'建议咨询人工',禁止编造";③ 角色从"客服助手"改为"有 5 年经验的电商客服,熟悉退换货和产品参数"。
回归测试:20 条全跑,准确率提升到 85%。退货政策全对,幻觉从 2 条降到 0 条,答非所问从 2 条降到 1 条。但发现新增了 1 条问题——有个问题智能体太保守了,本来能答的却说"咨询人工"。
第二轮优化:调整约束,把"不确定就说咨询人工"改为"知识库有明确答案的直接回答,没有明确答案的才建议咨询人工"。回归测试准确率到 90%。
两轮迭代,从 65% 到 90%。这就是数据驱动迭代的力量。

三个坑,做评估时最容易犯

避坑提醒
坑一:测试集和真实场景脱节:测试集全是"标准问题",但真实用户问得千奇百怪。测试集准确率 95%,上线后用户满意度 60%。解决:测试集必须从真实用户对话中提取,定期补充新出现的问题。
坑二:只看准确率不看幻觉率:准确率 90% 看起来不错,但剩下 10% 全是一本正经的胡说八道,对用户的伤害比"不知道"大得多。解决:幻觉率必须单独统计,高于 5% 就是红线。
坑三:改完不回归:改了提示词,只测了之前答错的那几条,发现都对了就上线。结果其他场景出了新问题。解决:每次改动必须跑完整测试集,不能只测目标用例。

智能体是养出来的,不是搭出来的

很多人以为智能体搭完就完事了,其实搭建只占 20% 的工作量,剩下 80% 是持续的评估和迭代。好的智能体不是一次设计出来的,是在真实使用中不断打磨出来的。
从今天开始,给你的智能体建一个最小测试集(哪怕只有 20 条),每周跑一次,记录指标,针对性优化。三个月后回头看,你会惊讶于它的进步。
至此,智能体设计五篇系列就完整了:提示词架构 → 多智能体协作 → 知识库搭建 → 护栏安全 → 效果评估。从基础到进阶,从能力到安全到优化,一套体系打下来,你的智能体设计能力已经超过大部分人了。
不能衡量的东西就不能改进。给智能体建一套评估体系,迭代才有方向。
作者声明:本作品含 AI 生成内容

选择样式

选择布局
选择颜色
选择背景图案
选择背景图片