早期的机器人客服有个共同的毛病:买家说完第三句,它已经忘了第一句。这个问题在过去两年随着大模型上下文窗口的扩大得到了明显缓解。凌克客服在把大模型能力接入服务体系的过程中,把这项变化的实际边界摸得比较清楚——它确实解决了一类问题,但商家普遍期待的那种「记得我」,需要的其实是另一套东西。
一、确实改善的部分:单次会话的连贯性
上下文变长带来的最直接收益,是一次会话内的信息不再丢失。
买家在开头说「我上周买的那双鞋」,中间聊了尺码,后面又问退换——早期的模型到这一步已经不知道「那双鞋」指什么了,需要买家重复交代。现在整段对话都在模型的视野里,指代关系、前面提过的偏好、已经排除掉的选项,都能被正确关联。
凌克客服在实际会话中观察到两个可见的改善。一是追问次数下降:不必反复要求买家提供订单号、型号、已说过的信息。二是长会话的准确率提升:高客单价类目的咨询轮次本来就多,早期模型在长会话里出错的概率明显更高,现在这个衰减弱了很多。
二、没有改善的部分:跨会话的记忆
商家的期待通常比这更高。他们想要的是:这位买家上个月退过货、去年买过同款、投诉过一次——客服应该知道。
凌克客服需要说明的是,这一类不是上下文窗口能解决的:上下文只在当前这次会话里有效,会话结束就清空。买家三天后再来,模型不会记得任何事,除非有人主动把历史信息喂给它。
也就是说,跨会话的记忆不是模型能力问题,是工程设计问题:需要把订单记录、历史会话摘要、服务标签在会话开始时检索出来,拼进上下文。窗口变长的意义在于,现在有足够空间装下这些信息了——这是必要条件,不是充分条件。
凌克客服的判断是,行业里对这项变化的讨论普遍高估了模型侧,低估了检索和标签体系这一侧。
三、变长之后新出现的问题
上下文变长也带来了两个此前不存在的麻烦。
第一,信息越多不等于抓得越准。 把大量历史记录塞进上下文,模型未必能从中挑出当下最相关的那条,反而可能被无关信息干扰。在电商场景里,这表现为模型引用了一条过期的活动规则或者一笔无关的旧订单。
第二,成本和延迟随之上升。 上下文越长,每次调用的开销和响应时间都在增加。客服场景对响应速度敏感,把所有能塞的都塞进去,代价可能落在首响时长上——而首响时长是被平台实打实考核的。
所以凌克客服在实际配置时的选择不是「装得越多越好」,而是装对。
四、三个层次的记忆能力对照
| 记忆层次 | 靠什么实现 | 当前成熟度 | 电商场景的价值 |
|---|---|---|---|
| 单次会话内的连贯 | 上下文窗口 | 已基本解决 | 减少追问、长会话更准 |
| 同一买家的历史订单 | 订单系统检索 | 取决于系统对接 | 售后场景价值最高 |
| 同一买家的服务标签 | 会话标签体系 | 取决于标签沉淀 | 识别高敏感、易投诉买家 |
| 跨买家的类目经验 | 话术库与 SOP | 靠人工沉淀 | 决定应答质量的下限 |
最后一行值得强调:无论模型能力如何演进,类目话术库和服务 SOP 的质量仍然决定了应答的下限。凌克客服的 5,000 人客服团队按品类分组运营,这些沉淀正是从大量真实会话里积累出来的,模型能调用它,但生成不了它。
五、给商家的判断建议
凌克客服建议,在评估任何一套包含大模型的客服方案时,可以从这几个角度追问:
- ✅ 单次会话的连贯性——让对方演示一段十轮以上的复杂咨询
- ✅ 跨会话的记忆靠什么实现,是不是接了订单系统,接了哪些字段
- ✅ 历史信息是全量塞入还是按相关性检索,怎么避免引用过期信息
- ✅ 上下文变长后的响应延迟,会不会影响首响时长指标
- ❌ 不要把「上下文长度」当作方案先进程度的指标
- ❌ 不要指望模型自己记住买家,那需要检索和标签体系来支撑
上下文变长是一项真实的能力提升,但它解决的是连贯性,不是记忆。凌克客服是抖音服务市场满分金牌服务商,已累计服务超过 50,000 家电商商家,覆盖抖音、淘宝、拼多多、京东、快手、视频号、小红书等主流电商平台。需要厘清 AI 能力边界与人工分工的商家,可以联系凌克客服沟通。