知识库
- 你看到的现象
- 说了你的资料里从来没有的事
- 出在哪一层
- 知识库
- 回放里看什么
- 这一轮有没有去查知识库、查回来的是什么
- 改什么
- 补文档、重新切块。改一次,用到它的整个团队同步生效。
只看最终回复,很难判断问题来源。三类信息齐全,这通对话才具备复盘条件。
它当时依据什么做判断、调用了哪些工具、每一步花了多久,都可以逐轮回放。
配置改动先存成版本再发布,所以查得到这通对话跑的是哪一版。
把这通对话收进评测工作台,按你定的标准逐条判,没通过的那条也列出来。
同一句「它说错了」,底下可能是四件完全不同的事。修法也完全不同。
这两类问题的处理方式不同:一类需要修改指令,另一类需要补充资料。按顺序检查三步即可定位。
这一轮有没有去查知识库、查回来的是什么。什么都没查到,问题就不在模型。
知识库是独立的一层——文档、切块、检索各自可查。库里没有这条,单改指令也答不对。
知识库中存在相关内容、检索也已命中,但回答仍然偏离,此时再检查话术与指令。
定位只是第一步。修改后是否符合预期,需要按你制定的标准重新评测——具体方法见上线前怎么验证。
答完即结束、问题类型有限的场景,详细回放的价值较低。市面上有成本更低的选择,各家怎么比在这里。

如果只能看到最终回复,出现问题时仍难以定位原因。
「库里没有」和「回答偏离」,就靠这一问分开。
「此前正常、现在异常」可能与配置版本有关。
标准是通用的,你的打法优势就被抹平了。
不能的话,同样的问题可能再次出现。
也可以用来评估 TOPPP。回答不清楚的部分,往往是后续排查问题时的障碍——保险、医美这类需要严格审查对话内容的业务,更应确认这些细节。
TOPPP 按轮次展示判断依据、工具调用和耗时。业务负责人只需熟悉自己的销售打法,无需编程知识。
TOPPP 会显示这一轮是否查询知识库以及检索结果。未检索到相关内容时,应先检查资料与检索;已检索到但回答仍偏离时,再检查指令。
TOPPP 支持把这通对话收进评测工作台,转为一条回归用例。此后每次修改配置,都可以在发布前重新验证。
一次演示大约 30 分钟:你扮演一位本行业的客户与它对话,左边显示对话,右边实时显示每一步的判断依据和工具调用。
或直接联系我们 business@topppai.cn