客服运营

错了六个星期的退款答案:AI 客服为什么必须标注来源

一个 bot 给四十位客户报错了退货期限,六周无人发现——因为自信的错误答案和正确答案长得一模一样。引用来源就是把它们区分开的手段。

一个护肤品牌跟我们聊过一件事:他们的客服 AI 一直在告诉客户"60 天内可退货"。实际政策是 30 天。那个 60 天,来自两年前黑五大促的临时政策——旧政策的 PDF 还躺在知识库里,检索照常把它捞了出来。整整六个星期,bot 底气十足地告诉了大约四十位客户:你有两个月可以反悔。

团队没人发现。发现的是一位客户——在她"退货倒计时"的第 45 天,带着截图找上门。

真正应该让你后背发凉的是:那些回答每一条都看起来很好。礼貌、格式工整、数字具体。如果你的 AI 不展示答案出处,此时此刻你的客服频道里大概率也跑着某个版本的同款事故,而你没有任何手段知道。

错的答案,看起来不错

真人客服没把握的时候,你看得出来:会打磕巴,会说"我查一下",会去问同事。语言模型答错的时候,语气跟答对时一模一样。流畅度和准确度是两个维度,而模型只给你看流畅度。

指望客户帮你发现也没戏。想想收到"60 天"答案的是谁——一群拿到了比真实政策更优惠条件的人,谁会投诉这个?客户只会举报"听起来就不对"的回答,对"听起来很对但其实错了"的回答毫无检测能力。于是"自信且错误"就这么隐身,直到真金白银动起来、有人翻出截图。

咬人最狠的三个场景

退换货政策。 这是客服 AI 依赖的所有文档里改动最频繁的。大促造出临时政策,临时政策变成散落文档,散落文档比大促活得久。AI 没有"现行版本"的概念——检索捞到什么,它就信什么。

运费模板。 "寄到阿尔伯塔多少钱"背后是地区表、重量档、一年调两次价的承运商。拿去年的表回答,答案精确、具体、且错——最糟的组合,因为一个具体的数字听起来远比模糊的说法权威。

保修条款。 不同产品线时长和范围都不同。问错一个 SKU,模型可能把两本说明书揉成一条读起来天衣无缝的回答,对两个产品都不适用。

注意共性:三个场景里文字都没毛病,出问题的是事实有版本。这恰恰是流畅度救不了你的地方。

一条引用,改变了什么

引用在界面上很小——答案下面一行"来源:退货政策,5 月 12 日更新"。但它彻底改写三个工作流。

抽查从几分钟降到几秒。 有来源,审核的人看一眼答案、瞄一眼被引段落,五秒结束。没来源,验证一条回答意味着去自家文档堆里猜 bot 可能读了什么——一条几分钟,实践中等于没人查,等于零审核。

纠纷有了取证链。 客户说"你们 bot 跟我说的是 X",你调出对话,不光看到它说了什么,还看到它读了什么。修复路径立刻清晰:文档错了改文档;文档没错答案错了,那是检索问题,找你的服务商。没有引用,每场纠纷都是考古。

过期文档现形。 这条本可以救那个护肤品牌。上线第一周,客服扫一眼群里的对话,看到一条平平无奇的周二回答下面写着"来源:BFCM 2024 退货活动",心里咯噔一下——这玩意怎么还活着——顺手删掉。引用把"无声的腐烂"变成"碍眼的杂物",而碍眼的东西总会被收拾。

让引用发挥作用的日常

引用只是展示层,它真正解锁的是一套很轻的纪律:

  • 一个事实只住一个文档。 退货期限只在一处出现。两个文档都写,它们早晚打架,AI 的回答就成了你看不见的抛硬币。
  • 政策正文里写生效日期。 "2026 年 3 月起生效"写进文档正文,不是只写在文件名里——引用预览里能看到,过期版本自己会暴露。
  • 每周十分钟抽查。 抽十条 AI 对话,对着来源读答案。答案和来源一致,过;矛盾,是检索 bug,上报;来源本身过期,是文档 bug,当场修。
  • 改政策必须连着删旧档。 政策变更日的清单是两项:传新文档,删旧文档。多数团队只做第一项,孤儿版本就是六周事故的温床。

这些都不重。但没有"哪篇文档产出了哪条回答"这个信息,一条都做不了。

挑服务商时该问什么

如果你在选型 AI 客服工具,"回答带不带来源"应该排进前五个问题,排在"用什么模型"前面。而且别停在有没有,往下追:

  • 引用的是具体段落,还是只含糊指个文档标题?
  • 客服在对话视图里能不能直接看到来源,不用跳出去?
  • 检索不到来源时,它是坦白说找不到并转人工,还是即兴发挥?

Lane.Chat 的每条 AI 回答下面都渲染来源,指向知识库里的具体段落,客服在会话里直接可见。设计目标就一条:任何同事都能在五秒内审计任何一条回答。

因为一条无法审计的 AI 回答,不叫自动化。叫语法很好的风险敞口。