智能体评测怎么做?6类问题测出它会不会越界
智能体评测怎么做,不能只问它一个熟悉的问题,看到回答顺眼就宣布上线。真正的使用者会换说法、漏掉关键信息、提出超出范围的要求,甚至把两条互相矛盾的资料同时丢进来。评测的价值,是提前找出这些时候它会不会编造、越权或把不确定的话说得太肯定,而不是替产品挑几张好看的回答截图。

先把“答得好”换成能被检查的标准
以活动咨询助手为例,“回答专业”不是一个可判分的目标;“只根据已确认的活动资料回答时间、地点和报名方式,资料里没有的内容明确说待人工确认”才是。每条测试题都应该有预期:它该回答哪些字段、哪些话不能说、什么时候必须停下来。没有预期,就只能凭印象争论这条回复算不算好。
评测样例最好来自真实但已经脱敏、已获授权的咨询或任务。不要把客户隐私、内部合同或未公开名单直接粘进去试系统。样例的目的不是堆数量,而是覆盖最可能出错的边界。
六类问题,比“再问十遍”更能看出问题
| 题目类型 | 用来检查什么 | 理想表现 |
|---|---|---|
| 正常问题 | 基本资料是否答全 | 引用范围内的信息,结构清楚 |
| 换说法问题 | 口语、简称和错别字能否理解 | 不因措辞变化丢掉关键条件 |
| 资料缺失 | 不知道时是否会编 | 标出缺失并给出人工确认路径 |
| 范围外请求 | 边界是否真实生效 | 礼貌拒绝或分流,不伪造处理结果 |
| 冲突信息 | 能否识别不同版本不一致 | 说明需要确认的来源或版本 |
| 高风险请求 | 会不会替人做决定 | 停止自动判断,转交有职责的人 |
例如,已知活动资料写的是“报名截止到周三”,就分别测试“周三晚上还能报吗”“我没看到截止时间”“帮我把朋友也加进去”“你替我确认我的名额”这些问法。第一类可以直接答;第二类要看它是否真的从资料里找;后三类则考验是否把报名规则、个人状态和人工权限混在一起。
先把正常、模糊、缺资料和范围外的问题各写几条,并在旁边标出每条的预期处理。
一次只改一个地方,结果才有解释
很多团队一看到结果不好,就同时换模型、补资料、加插件、重写提示词和调整工作流。下一轮即使变好,也无法知道真正起作用的是哪一项。更可复核的顺序是:固定测试题和资料版本,先只改输出要求或任务边界;确认效果后,再检查工作流中的资料、工具和人工确认点;最后才比较账号当前可用的模型或工具。
AstronClaw 官方页面公开展示了提示词、工作流、模型、插件、MCP Server 和一站式效果测评方向。它适合用来把一个重复任务拆成可以验证的智能体流程。具体功能入口、可使用模型和发布条件会随账号变化,应以当前页面为准;不应把“有测评”理解为平台会自动替业务承担事实、合规或对外承诺的判断。
留一张失败清单,比留成功截图更有用
- 记录失败题号和现象:例如“第 12 题把候补规则说成已确认名额”,不要只写“偶尔不准”。
- 写清是资料、规则还是流程问题:若资料本来没有答案,不应靠把提示词写得更强硬来掩盖。
- 决定这个问题的处置:可以补资料、改规则、增加人工接管,或者干脆把它排除在第一版范围之外。
- 复测同一题库:改动后必须回到原题比较,才知道改善有没有以牺牲另一类结果为代价。
上线前的目标不是让智能体回答所有问题,而是让它在该回答时稳定回答、在不该回答时清楚停下。涉及个人资料、付款、账号、法律医疗财务建议或会影响用户权益的操作,仍要由有职责的人设定审核和接管方式。
题库和预期写好后,再把每次修改前后的答案放在同一组问题里对比。
Q:测试题越多越好吗? A:先覆盖六类高风险情况比盲目堆题更重要。题库稳定后,再根据真实咨询中反复出现的问题补充。
Q:评分低就该换模型吗? A:先检查资料是否完整、边界是否清楚、测试预期是否合理。模型只是变量之一,不能替代任务设计。
