跳到正文

AI 客服上线前,怎么验证它不会说错话?

这一页只讲质量关卡:上线前依据什么放行,修改配置后如何确认原有能力没有受到影响。

靠证据,不靠承诺

上线前不是增加几轮对话凭感觉判断,而是先把红线写成可判定的规则。确定性断言由机器判定——必须包含的信息、必须调用的工具、禁止出现的表述逐项检查;裁判模型按你的标准评估质量。两轨分开记录,才能为「评测通过」提供可追溯的证据。

一段演示与一套质量关卡,证据有什么不同

同样一句“上线前验过了”,背后的证据可能完全不同。

合格的定义

你现在手上有的
一句“我们测过了”。但测了什么、由谁制定标准并不清楚。
有质量关卡之后
合格 = 你写下来的那几条规则全部命中。标准是你定的,不是行业平均值。

谁在判

你现在手上有的
演示时选取一段表现较好的对话。
有质量关卡之后
硬规则机器判,软质量模型判,两轨的结论分开记。

红线怎么管

你现在手上有的
写进一段提示词,是否遵守仍依赖模型当次输出。
有质量关卡之后
禁止出现的话、禁止调用的工具逐条断言,违一条即不通过。

跑几次算数

你现在手上有的
一次对话表现良好,就据此判断整体表现。
有质量关卡之后
同一条用例运行多轮,检查结果是否稳定,而不是依据单次表现。

改完之后

你现在手上有的
再进行几轮对话,凭印象判断是否受到影响。
有质量关卡之后
结果绑在配置版本上,和上一版逐条比,也可以退回去。

一条用例,两轨判定

同一条用例运行后,两个结论分开记录:硬规则是否全部命中,软质量是否达到标准。任一结论不合格,这条用例就不通过。

确定性断言

  • 必须包含:报价口径、免责说明这类必须说到的话
  • 至少包含其一:多种说法都算对时,给一组等价表达
  • 禁止包含:越权承诺、保证效果这类红线,出现即不通过
  • 必须调用:需要查询库存时调用库存工具,需要创建工单时调用工单工具
  • 禁止调用:未授权的工具不能调用

裁判模型

  • 期望回复:给一条参照答案,不要求逐字相同
  • 评判标准:你自己列的几条,比如有没有确认预算、有没有推进到下一步
  • 裁判模型可配置:可以选择由哪个模型执行评判

不合格时,可以定位到具体规则

评测工作台给的不是一个分数。一条用例跑完,留下的是这些。

复盘工位上摊开的记录本与关掉的台灯:一条评测用例跑完后留下的判定结论、命中的规则与完整对话记录。
  • 硬规则结论

    确定性断言有没有全部命中,单独给一个结论。

  • 软质量结论

    裁判模型有没有通过,连同判断理由一起留下。

  • 逐条明细

    哪一条断言没有命中,结果中逐条说明,而不是只给总分。

  • 工具调用记录

    这一轮实际调用了哪些工具、传了什么参数。

  • 完整轨迹

    每一轮的思考、检索命中与调用,可以逐帧回放。

  • 耗时

    这条用例运行了多久,耗时集中在哪一步,都有记录。

修改后如何确认没有引入回归

配置修改不会立即作用于正在运行的 AI 员工。每次修改先保存为新版本,完成评测后再显式生效。

  1. 01

    改完存成新版本。线上接客户的,还是原来那一版。

  2. 02

    评测

    使用同一套用例执行完整评测,不只验证本次改动的部分。

  3. 03

    结果与版本关联,可以和上一版逐条比较:哪些问题已修复,哪些能力出现回归。

  4. 04

    上或退

    确认结果符合预期后让新版本生效;发现异常时退回上一个版本。需要显式应用新版本。

因此,是否引入回归不依赖回忆,而是比较两个版本的评测结果。

这道关卡的能力边界

边界写清楚,比多列一条功能有用。

用例之外的场景无法直接判定

  • 用例之外的场景无法直接判定:评测只覆盖已写进用例的场景。未覆盖的问法可能首次出现在线上,因此问题对话需要回流为新用例,纳入下一轮评测。
  • 它不替你定标准:什么叫“说得好”,每家不一样。规则是你写的,我们不预置一套“行业通用合格线”——预置的那种,抹掉的正是你的打法。

只需要 FAQ 机器人的团队不适合这套关卡

  • 如果需求只是答完问题即结束,这一层验证的成本较难体现价值。市面上有成本更低的选择。

选型时,先问清 AI 质量评测怎么做

评估 AI 客服、AI 销售员工或对话式 Agent 时,重点不是演示有多顺,而是确认质量评测、规则断言与版本回归是否可验证。

空着的选型洽谈室:评估 AI 客服或 AI 销售员工时,先问清质量评测、规则断言与版本回归怎么做。
  • 合格标准由谁定义

    合格线是谁定的?能否按你的业务规则写成可执行的评测标准,而不是只能接受一套通用指标?

  • 红线能否被自动判定

    “不能说的话”和“不能调的工具”,是提示词里的一句叮嘱,还是能让 AI 客服评测直接判定失败的断言?

  • 失败结果是否可追溯

    不合格的时候,我能看到具体哪一条规则没通过、对应哪段对话吗,还是最终只拿到一个总分?

  • 多轮评测是否稳定

    同一条业务用例连续运行多轮,结论是否一致?只有稳定的结果,才适合拿来做上线前质量评估。

  • 配置变更能否回归

    修改 AI 配置后,如何在上线前确认其他能力未受影响?如果出现回归,能否对比版本并退回上一版?

关于这道关卡

评测由你们运行,我如何验证结果?

因为规则不是 TOPPP 单方面制定的。合格线、禁止出现的表述、必须调用的工具都在你的配置里;结果提供逐条明细和完整轨迹,而不只是一个分数。选择一条未通过的用例,就可以查看具体未满足哪条规则。

上线之后还要继续评测吗?

要。TOPPP 支持把线上的问题对话导入成新用例,经人工审核后进数据集,下一次改配置时它就是回归的一部分。审核有一条硬约束:一条用例必须至少带一条确定性规则或一条裁判标准,否则不能通过审核——空用例进不了数据集。

都验过了,AI 还是说错了怎么办?

评测是三道防线里的第一道。第二道是把问题对话回流为新用例,纳入后续迭代;第三道是人工接管——按联系人切换,把这个客户交还给人,交接发生在后台,客户侧对话保持连续。

带上一个你最担心它答错的问题

一次演示约 30 分钟。我们会拿你业务里真实存在的那个难题,一起把它写成一条可判定的用例:

  1. 01该说到什么:报价口径、必须给到的提醒
  2. 02绝不能出现什么:越权承诺、你们行业的红线
  3. 03由谁来判:哪几条机器判,哪几条交给裁判模型

也可以直接联系我们 business@topppai.cn

预约演示

留下联系方式,我们会在一个工作日内联系你。

只聊你的业务,不群发广告。