引言:验收测试不是测FAQ命中率

很多企业验收智能客服,只做一个测试:准备几个标准问题,看机器人能不能答对。答对率超过80%,就认为验收通过了。
这种做法在智能家电场景下远远不够。
家电售后的客户提问方式千差万别。同一个报修意图,有人说得完整,有人只说半句,有人夹杂型号和地址信息,有人只说"坏了"。AI能不能准确识别意图,能不能追问缺失信息,能不能把采集到的字段填入工单,能不能在解决不了的时候转人工——这些环节全部跑通,才能说验收通过。

本文从智能家电实际落地经验出发,提供一套验收测试清单,覆盖三个核心场景:安装预约、故障报修、投诉受理。每个场景下,按六个测试维度逐项检查。

在线-坐席分配 (2).jpg

验收测试的整体框架

智能客服上线前的验收测试,建议按六个维度组织:
维度
测试目标
不通过的表现
意图识别
客户用不同说法表达同一意思,AI能否准确识别
识别错误或拒绝识别
缺失字段追问
客户没说全的信息,AI能否主动追问
直接报错或胡乱回答
知识回答
客户问知识库内的问题,AI能否准确回答
答非所问或说"不知道"
转人工
无法回答的问题,AI能否转人工
答非所问或死循环
表单生成
采集字段后能否自动生成表单
字段不全或格式错误
工单回写
表单能否自动生成工单,写入业务系统
工单字段缺失或未创建

场景一:安装预约

场景描述

客户买了家电,需要预约上门安装。客户通过电话或在线渠道联系客服,AI需要识别安装意图,采集必要信息,完成预约,生成工单。

测试用例清单

测试1:意图识别——不同说法都能识别
测试用例
客户说法
期望识别结果
通过标准
标准表达
"我刚买了台空调,什么时候能安排安装?"
安装预约
正确识别
口语表达
"师傅什么时候来装空调啊?"
安装预约
正确识别
模糊表达
"我家的洗衣机到了,需要安排一下"
安装预约
正确识别为安装而非维修
混合表达
"我买了个热水器,你们说包安装的,帮我约个时间"
安装预约
正确识别
关键检查点:客户的"安装"和"维修"说法有时很接近,比如"我家空调装不上"可能被误判为维修,需要确认AI能否区分。
测试2:缺失字段追问
客户说"我买了个冰箱,什么时候来装",缺少关键信息,AI必须主动追问:
缺失字段
期望追问内容
通过标准
产品型号
"请问您的冰箱是什么型号?"
追问到型号
客户姓名
"请问您的姓名是?"
追问到姓名
联系电话
"请问您的联系电话是?"
追问到电话
收货地址
"请问您的安装地址是?"
追问到地址
期望安装时间
"您希望什么时间上门安装?"
追问到时间
关键检查点:AI不能因为客户没说全就报错或拒绝回答,必须能多轮追问补齐信息。追问时不能重复问已经确认的信息。
测试3:知识回答
客户在安装预约过程中可能问一些知识性问题:
测试用例
客户说法
期望回答
政策咨询
"安装收费吗?保内还是保外?"
告知安装政策和收费标准
流程咨询
"安装大概要多久?"
告知安装时长预估
条件咨询
"安装需要准备什么?"
告知安装前准备事项
关键检查点:知识回答不能和官方政策不一致,建议用知识库配置的标准答案,而不是让AI自由发挥。
测试4:转人工
测试用例
客户说法
期望行为
通过标准
超出范围
"我想把安装时间改到下周,但系统约不了"
转人工
成功转人工,携带上下文
情绪波动
"你们怎么搞的,约了三天了还没人来!"
转人工
转人工,备注客户情绪
复杂需求
"我需要同时安装空调、热水器和净水器,时间要协调"
转人工
转人工,携带已采集信息
关键检查点:转人工时,AI采集到的信息(客户姓名、电话、地址、产品型号、期望时间)必须传递给人工坐席,客户不需要重复说一遍。
测试5:表单生成
AI完成信息采集后,能否自动生成标准的安装预约表单:
检查项
通过标准
字段完整性
包含客户姓名、电话、地址、产品型号、期望安装时间
字段格式正确
电话格式正确,时间格式标准
表单可查看
坐席在工单系统中能看到完整表单
测试6:工单回写
检查项
通过标准
工单创建
表单提交后自动创建工单
工单状态
工单状态正确(如"待派单")
工单回写
工单信息回写CRM或业务系统

场景二:故障报修

场景描述

客户的家电出现故障,联系客服报修。AI需要识别保修意图,判断是保内还是保外,采集设备信息,创建报修工单。

测试用例清单

测试1:意图识别
测试用例
客户说法
期望识别结果
通过标准
标准表达
"我的空调不制冷了,报修"
故障报修
正确识别
口语表达
"师傅,我家热水器打不着火了"
故障报修
正确识别
半截话
"冰箱坏了"
故障报修
正确识别
带型号
"我的KFR-35GW空调不制冷了"
故障报修
正确识别,同时提取型号
关键检查点:客户的"报修"说法可能和"咨询"混在一起,比如"我家的空调不制冷了,是不是缺氟啊"——AI需要识别这是报修意图,而不是普通的咨询意图。
测试2:缺失字段追问
报修场景需要采集的字段比安装更多:
缺失字段
期望追问内容
通过标准
产品型号
"请问您的空调是什么型号?"
追问到型号
故障现象
"具体是什么故障现象?"
追问到具体描述
购买时间
"请问您是什么时候购买的?"
追问到购买时间,辅助判断保内保外
客户信息
"请问您的姓名和电话是?"
追问到姓名和电话
地址
"请问您的地址是?"
追问到地址
关键检查点:AI需要根据客户提供的购买时间,自动判断保内还是保外,并告知客户保修政策。
测试3:知识回答
测试用例
期望回答
"保修期是多久?"
告知该型号的保修政策
"维修要收费吗?"
判断保内保外后告知是否收费
"维修师傅什么时候能来?"
告知维修派单流程和预估时间
关键检查点:保修政策类回答必须准确,涉及保内保外判断的,需要AI明确告知判断依据,不能模棱两可。
测试4:转人工
测试用例
期望行为
故障复杂无法判断
转人工,携带故障描述和已采集信息
客户情绪激动(多次故障)
转人工,备注投诉倾向
客户要求指定工程师
转人工,携带客户要求
测试5:表单生成
报修表单需要包含的字段:
字段
说明
产品型号
客户提供或系统查询
故障描述
客户描述的关键词
保内/保外
AI自动判断
客户姓名
采集
联系电话
采集
地址
采集
期望上门时间
采集
测试6:工单回写
检查项
通过标准
工单类型
正确创建为"报修工单"
工单优先级
根据故障类型自动判断优先级
工单分配
按区域分配到对应工程师
回写CRM
报修记录写入客户档案

场景三:投诉受理

场景描述

客户对产品、服务或工程师不满意,投诉。投诉场景比报修更敏感,对AI的要求更高。

测试用例清单

测试1:意图识别
测试用例
客户说法
期望识别结果
通过标准
标准表达
"我要投诉"
投诉受理
正确识别
隐含表达
"你们那个师傅态度太差了"
投诉受理
正确识别
混合表达
"我报修了三次都没人来,我要投诉"
投诉受理
正确识别,同时识别超时背景
关键检查点:投诉意图识别最关键的是情绪感知。客户说"太差了""什么服务"这些词,AI需要能识别出投诉倾向,不能当作普通咨询处理。
测试2:缺失字段追问
投诉场景需要采集的信息:
缺失字段
期望追问内容
投诉对象
"请问您要投诉的是哪个方面?产品质量还是服务?"
具体事件
"请您描述一下具体经过"
涉及订单/工单
"方便提供一下您的订单号或工单号吗?"
客户信息
"请问您的姓名和电话是?"
关键检查点:投诉场景追问时语气要温和,不能显得在审问客户。AI需要用"请您描述一下"而不是"请提供投诉对象"这样的生硬表达。
测试3:知识回答
投诉场景的知识回答和安装报修不一样,不是回答标准问题,而是安抚和引导:
客户说法
期望回答策略
"你们服务太差了"
先道歉,再引导描述具体问题
"我要找你们经理"
告知升级流程,转人工
关键检查点:投诉场景中,AI不要尝试解释或辩解,应该先道歉、再采集信息、转人工处理。
测试4:转人工
投诉场景转人工是最重要的环节。几乎所有的投诉最终都需要人工处理,AI的作用是采集信息并平稳转接。
检查项
通过标准
转人工触发
识别投诉后及时转人工,不要让AI反复安抚
上下文传递
投诉对象、事件描述、客户信息完整传递给人工
客户情绪标记
在工单中标记客户情绪状态
测试5:表单生成
投诉表单需要包含的字段:
字段
说明
投诉类型
产品质量/服务态度/维修质量/其他
投诉对象
产品/工程师/流程/其他
事件描述
客户描述的关键信息
涉及工单号
如果有历史工单,自动关联
客户信息
姓名、电话
客户情绪
平静/不满/愤怒
测试6:工单回写
检查项
通过标准
工单类型
正确创建为"投诉工单"
工单优先级
投诉工单优先级高于普通报修
工单分配
分配到投诉处理专员
回写CRM
投诉记录写入客户档案

验收测试的执行流程

第一步:准备测试数据

从真实服务记录中挑选20-30条典型客户对话,覆盖安装、报修、投诉三个场景,每个场景至少包含:
  • 标准表达案例

  • 口语表达案例

  • 半截话案例

  • 情绪案例

  • 复杂案例(多个意图混合)

第二步:逐个场景测试

按上述六个维度,每个场景逐一测试。建议用表格记录每个测试用例的通过/不通过情况。

第三步:统计通过率

维度
建议通过标准
意图识别
准确率≥90%
缺失字段追问
准确率≥85%
知识回答
准确率≥90%
转人工
成功率≥95%
表单生成
字段完整率≥95%
工单回写
成功率≥95%

第四步:Badcase 复盘

不通过的测试用例,逐条分析原因:
  • 是意图识别模型的问题?

  • 是知识库内容不完整?

  • 是流程编排有遗漏?

  • 是接口对接有问题?

修复后,重新测试,直到达到通过标准。

验收测试的常见误区

误区一:只测标准问法

很多企业验收时只测"标准问法",比如"我要报修空调"。但真实客户说话五花八门,不测口语表达、半截话、模糊表达,上线后客户用自己习惯的方式问,AI识别不了。

误区二:只测FAQ,不测流程

测试只问"空调保修期多久"这种单轮问题,不测试多轮追问、表单生成、工单回写这些流程能力。结果是FAQ命中率很高,但真正跑业务的时候,流程断了。

误区三:不测转人工质量

测试了转人工会不会触发,但没测转人工时上下文能不能传递过去。结果客户转人工后,又要重新说一遍,满意度下降。

误区四:不测边缘情况

只测正常情况,不测极端情况:客户不说话、客户只发图片、客户打错字、客户用方言说。这些边缘情况,验收时想到了,上线后就不会踩坑。


智能家电智能客服上线验收,核心不是测"机器人能不能回答问题",而是测"真实业务场景能不能跑通"。安装预约、故障报修、投诉受理这三个场景覆盖了家电售后80%以上的服务请求,每个场景按意图识别、缺失字段追问、知识回答、转人工、表单生成、工单回写六个维度逐一测试,验收通过率才有参考价值。

合力亿捷在多个家电品牌的落地实践中,已经积累了这套验收测试框架。验收不是最后一关,而是上线前的质量门禁——验收通过不了,说明Agent在真实业务场景中还没有准备好上岗。如果验收阶段发现大量Badcase,可以从意图识别、知识库内容、流程编排和系统对接四个方向定位问题,修复后再测,直到跑通。