合格的定义
- 你现在手上有的
- 一句“我们测过了”。但测了什么、由谁制定标准并不清楚。
- 有质量关卡之后
- 合格 = 你写下来的那几条规则全部命中。标准是你定的,不是行业平均值。
上线前不是增加几轮对话凭感觉判断,而是先把红线写成可判定的规则。确定性断言由机器判定——必须包含的信息、必须调用的工具、禁止出现的表述逐项检查;裁判模型按你的标准评估质量。两轨分开记录,才能为「评测通过」提供可追溯的证据。
同样一句“上线前验过了”,背后的证据可能完全不同。
同一条用例运行后,两个结论分开记录:硬规则是否全部命中,软质量是否达到标准。任一结论不合格,这条用例就不通过。
评测工作台给的不是一个分数。一条用例跑完,留下的是这些。

确定性断言有没有全部命中,单独给一个结论。
裁判模型有没有通过,连同判断理由一起留下。
哪一条断言没有命中,结果中逐条说明,而不是只给总分。
这一轮实际调用了哪些工具、传了什么参数。
每一轮的思考、检索命中与调用,可以逐帧回放。
这条用例运行了多久,耗时集中在哪一步,都有记录。
配置修改不会立即作用于正在运行的 AI 员工。每次修改先保存为新版本,完成评测后再显式生效。
改完存成新版本。线上接客户的,还是原来那一版。
使用同一套用例执行完整评测,不只验证本次改动的部分。
结果与版本关联,可以和上一版逐条比较:哪些问题已修复,哪些能力出现回归。
确认结果符合预期后让新版本生效;发现异常时退回上一个版本。需要显式应用新版本。
因此,是否引入回归不依赖回忆,而是比较两个版本的评测结果。
边界写清楚,比多列一条功能有用。
评估 AI 客服、AI 销售员工或对话式 Agent 时,重点不是演示有多顺,而是确认质量评测、规则断言与版本回归是否可验证。

合格线是谁定的?能否按你的业务规则写成可执行的评测标准,而不是只能接受一套通用指标?
“不能说的话”和“不能调的工具”,是提示词里的一句叮嘱,还是能让 AI 客服评测直接判定失败的断言?
不合格的时候,我能看到具体哪一条规则没通过、对应哪段对话吗,还是最终只拿到一个总分?
同一条业务用例连续运行多轮,结论是否一致?只有稳定的结果,才适合拿来做上线前质量评估。
修改 AI 配置后,如何在上线前确认其他能力未受影响?如果出现回归,能否对比版本并退回上一版?
因为规则不是 TOPPP 单方面制定的。合格线、禁止出现的表述、必须调用的工具都在你的配置里;结果提供逐条明细和完整轨迹,而不只是一个分数。选择一条未通过的用例,就可以查看具体未满足哪条规则。
要。TOPPP 支持把线上的问题对话导入成新用例,经人工审核后进数据集,下一次改配置时它就是回归的一部分。审核有一条硬约束:一条用例必须至少带一条确定性规则或一条裁判标准,否则不能通过审核——空用例进不了数据集。
评测是三道防线里的第一道。第二道是把问题对话回流为新用例,纳入后续迭代;第三道是人工接管——按联系人切换,把这个客户交还给人,交接发生在后台,客户侧对话保持连续。
一次演示约 30 分钟。我们会拿你业务里真实存在的那个难题,一起把它写成一条可判定的用例:
也可以直接联系我们 business@topppai.cn