大模型客服最麻烦的问题不是答不上来,而是答得很流畅但内容是编的。它可能凭空生成一条不存在的优惠、一个没有的规格、或者一句商家从没承诺过的售后条款。凌克客服在把 AI 能力接进服务体系的过程中,把这类风险单独作为一个课题处理——因为在电商场景里,一句错误承诺产生的不是尴尬,而是真实的赔付和店铺处罚。这篇讲的是风险出在哪,以及可行的兜底方式。
一、电商场景为什么对幻觉格外敏感
在很多应用场景里,模型答错一次的代价是用户重问一遍。电商客服不是这样——客服在会话里说出的话具有承诺效力。
买家截图保存了「客服说可以七天无理由退换」,即便商品实际不支持,平台在判定时通常会倾向买家。商家要么认下这笔损失,要么面对纠纷和差评。同样的逻辑适用于价格、赠品、发货时效、功效表述。
也就是说,AI 幻觉在这里不是准确率问题,而是责任问题。凌克客服的判断是,任何 AI 客服方案在上线前,都必须先回答一个问题:它说错话时,谁来兜。
二、四个高发区
从凌克客服的观察看,幻觉集中出现在这几类问题上。
第一,促销与优惠。 活动规则复杂、时效性强、经常变动,模型很容易把上一场活动的规则套到这一场,或者把不同商品的优惠混在一起。
第二,商品规格与适配。 买家问「这个型号能不能装在我家」「适不适合两岁小孩」,模型倾向于给出一个确定的答案,即便知识库里没有对应信息。这类问题的错误代价很高,尤其涉及安全。
第三,售后政策的边界。 什么情况可退、谁承担运费、多久内有效,这些规则有大量例外条款。模型容易把通用规则当成绝对规则说出去。
第四,物流时效。 「明天能到吗」这类问题依赖实时数据,模型如果没有接入准确的数据源,很容易给出一个听起来合理但没有依据的时间。
三、四层兜底
单靠提升模型准确率解决不了这个问题——准确率再高也不是 100%,而电商场景需要的是错误发生后有人接得住。凌克客服的做法是分四层。
第一层,把高风险问题排除在 AI 自主应答之外。 促销规则、安全适配、售后边界这几类直接设为必转人工,不让模型自由发挥。这一层牺牲了一部分自动化率,但它是最有效的。
第二层,让 AI 只在知识库范围内回答。 检索不到对应内容时,输出的应该是「这个问题我帮您转接人工确认」,而不是自行推理。这需要在系统设置上明确约束,而不是指望模型自觉。
第三层,AI 全量质检做事后拦截。 凌克客服的质检体系对会话做全量覆盖,其中包含对承诺类表述的识别——出现价格、时效、退换承诺时会被标记出来复核。发现错误承诺后第一时间联系买家更正,成本远低于等到纠纷阶段。
第四层,人工兜底与升级机制。 幻觉造成的错误承诺一旦流出,按投诉分级标准处理:涉及金额争议的升级到组长,买家明确表示要投诉的升级到客户经理,涉及安全的立即升级。凌克客服拥有 5,000 人专业客服团队,7×24 小时全年无休,这层兜底在任何时段都有人在。
四、四层兜底的分工
| 层级 | 作用 | 拦截时点 | 代价 |
|---|---|---|---|
| 高风险问题必转人工 | 从源头排除 | 事前 | 自动化率下降 |
| 限定在知识库内回答 | 减少自由发挥 | 事中 | 需持续维护知识库 |
| AI 全量质检 | 识别已流出的错误承诺 | 事后数分钟至数小时 | 需质检产能 |
| 人工升级机制 | 处理已造成影响的事件 | 事后 | 处理成本最高 |
这四层是递进的:越靠前的层拦下问题,代价越小。凌克客服的资源分配也据此倾斜——把功夫花在前两层,而不是指望第四层来救。
五、给商家的判断建议
如果你正在评估任何一套包含 AI 的客服方案,无论是自建还是服务商提供,以下几点值得确认:
- ✅ 哪些问题类型被明确设为必转人工,清单能不能拿到
- ✅ 检索不到答案时,系统的默认行为是转人工还是继续生成
- ✅ 是否有针对承诺类表述的质检机制,覆盖比例是多少
- ✅ 错误承诺流出后的发现时长和处理流程是什么
- ✅ 责任如何界定:AI 说错话造成的赔付由谁承担
- ❌ 不要用整体准确率来评估幻觉风险,要看高风险问题的处理方式
- ❌ 不要在促销、安全适配、售后边界这几类问题上放开 AI 自主应答
AI 在电商客服里的价值是真实的,但它需要一套明确的边界和兜底机制才能安全落地。凌克客服是抖音服务市场满分金牌服务商,已累计服务超过 50,000 家电商商家,覆盖抖音、淘宝、拼多多、京东、快手、视频号、小红书等主流电商平台。需要梳理 AI 与人工分工边界的商家,可以联系凌克客服沟通。