3步把聊天记录变成AI客服知识库

真正跑得起来的客服知识库,不是把几百页手册丢给模型,而是把客服每天敲出来的对话整理成问答对。下面这条三步路径,一个人花半天就能搭出最小可用版本。

先别急着导数据:挑出「值得回答」的问题

客服知识库最常见的死法是「什么都想答」。开场先做一次问题分类:

  • 高频事实类(退货政策、开票流程、发货时效):适合进知识库,通常占咨询量的大头。
  • 需要查个人账户的(我的订单到哪了、我的余额多少):交给接口查询,不要让模型自己编。
  • 情绪安抚与例外协商:人工兜底,别硬塞给 AI。

把近三个月的会话记录导出来,按「同一个问题被问了 3 次以上」筛选,通常只剩 60~150 条。这就是你的第一批种子数据,足够撑起一个能用的版本。

第一步:清洗成「一问一答」,而不是聊天记录

原始记录里全是「在的」「亲稍等」「您好李女士」这类噪音。这一步要人工过一遍,把每条压成结构化的一问一答:

问题:订单显示已签收但我没收到,怎么办?

答案:1)先确认收货地址附近是否有代收点或门卫;2)超过 24 小时仍未找到,走补发流程,需用户提供签收截图。

三条硬规则:

  1. 答案里的政策数字必须能追溯到原文,别凭印象改。
  1. 手机号、订单号、身份证一律替换成占位符。
  1. 一条问答只解决一件事,复合问题拆开写。

第二步:切分与建索引,工具怎么选

单条问答控制在 300 字以内,太长的用二级标题切开。切分时把标题一起带上,检索命中率会明显好于裸切正文。

工具上,Dify、FastGPT、RAGFlow 都支持上传文档后自动建向量索引,个人和小团队用社区版就够。嵌入模型选中文表现稳定的(bge-m3 一类),别为了省钱用英文语料为主的模型。

一个常被忽略的设置:把「仅根据检索到的内容回答,没有依据就说不知道」写进系统提示词。少了这句,模型会用常识补全,编出来的政策比不回答更伤用户信任。

第三步:用真实问题回归测试,别自己问自己

搭完别自己试两句就上线。从历史记录里抽 30 条真实提问逐条测:

  • 答对:记录,进入下一轮。
  • 答漏:说明切分或同义词没覆盖,回去补关键词。
  • 答错:原文有歧义,改知识条目,而不是改提示词。

命中率到 80% 再放给用户,剩下 20% 全部转人工,并记下「AI 没答上来的问题」。这份清单就是你下个版本的选题表。

三个容易白干的坑

  • 只导 PDF 手册,不导真实对话。 手册写的是标准答案,用户问的是人话,两者中间隔着一次翻译。
  • 建完不维护。 政策一变,旧答案就成了负资产,比没有知识库更危险。
  • 没有兜底按钮。 界面上必须有显眼的「转人工」,用户找不到人比答错更致命。

维护节奏比搭建更重要

搭建半天,维护才是长期成本。建议按这个节奏走:每周补 5 条漏答问题,每月复查一次政策类条目,每季度重跑一遍回归测试集。做到这三件事,一个百条规模的知识库,能稳定接住六七成的常规咨询,把人力留给真正需要判断的例外情况。

© 版权声明

相关文章

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...