引言:验收测试不是测FAQ命中率
很多企业验收智能客服,只做一个测试:准备几个标准问题,看机器人能不能答对。答对率超过80%,就认为验收通过了。
这种做法在智能家电场景下远远不够。
家电售后的客户提问方式千差万别。同一个报修意图,有人说得完整,有人只说半句,有人夹杂型号和地址信息,有人只说"坏了"。AI能不能准确识别意图,能不能追问缺失信息,能不能把采集到的字段填入工单,能不能在解决不了的时候转人工——这些环节全部跑通,才能说验收通过。
本文从智能家电实际落地经验出发,提供一套验收测试清单,覆盖三个核心场景:安装预约、故障报修、投诉受理。每个场景下,按六个测试维度逐项检查。

验收测试的整体框架
智能客服上线前的验收测试,建议按六个维度组织:
维度 | 测试目标 | 不通过的表现 |
意图识别 | 客户用不同说法表达同一意思,AI能否准确识别 | 识别错误或拒绝识别 |
缺失字段追问 | 客户没说全的信息,AI能否主动追问 | 直接报错或胡乱回答 |
知识回答 | 客户问知识库内的问题,AI能否准确回答 | 答非所问或说"不知道" |
转人工 | 无法回答的问题,AI能否转人工 | 答非所问或死循环 |
表单生成 | 采集字段后能否自动生成表单 | 字段不全或格式错误 |
工单回写 | 表单能否自动生成工单,写入业务系统 | 工单字段缺失或未创建 |
场景一:安装预约
场景描述
客户买了家电,需要预约上门安装。客户通过电话或在线渠道联系客服,AI需要识别安装意图,采集必要信息,完成预约,生成工单。
测试用例清单
测试1:意图识别——不同说法都能识别
测试用例 | 客户说法 | 期望识别结果 | 通过标准 |
标准表达 | "我刚买了台空调,什么时候能安排安装?" | 安装预约 | 正确识别 |
口语表达 | "师傅什么时候来装空调啊?" | 安装预约 | 正确识别 |
模糊表达 | "我家的洗衣机到了,需要安排一下" | 安装预约 | 正确识别为安装而非维修 |
混合表达 | "我买了个热水器,你们说包安装的,帮我约个时间" | 安装预约 | 正确识别 |
关键检查点:客户的"安装"和"维修"说法有时很接近,比如"我家空调装不上"可能被误判为维修,需要确认AI能否区分。
测试2:缺失字段追问
客户说"我买了个冰箱,什么时候来装",缺少关键信息,AI必须主动追问:
缺失字段 | 期望追问内容 | 通过标准 |
产品型号 | "请问您的冰箱是什么型号?" | 追问到型号 |
客户姓名 | "请问您的姓名是?" | 追问到姓名 |
联系电话 | "请问您的联系电话是?" | 追问到电话 |
收货地址 | "请问您的安装地址是?" | 追问到地址 |
期望安装时间 | "您希望什么时间上门安装?" | 追问到时间 |
关键检查点:AI不能因为客户没说全就报错或拒绝回答,必须能多轮追问补齐信息。追问时不能重复问已经确认的信息。
测试3:知识回答
客户在安装预约过程中可能问一些知识性问题:
测试用例 | 客户说法 | 期望回答 |
政策咨询 | "安装收费吗?保内还是保外?" | 告知安装政策和收费标准 |
流程咨询 | "安装大概要多久?" | 告知安装时长预估 |
条件咨询 | "安装需要准备什么?" | 告知安装前准备事项 |
关键检查点:知识回答不能和官方政策不一致,建议用知识库配置的标准答案,而不是让AI自由发挥。
测试4:转人工
测试用例 | 客户说法 | 期望行为 | 通过标准 |
超出范围 | "我想把安装时间改到下周,但系统约不了" | 转人工 | 成功转人工,携带上下文 |
情绪波动 | "你们怎么搞的,约了三天了还没人来!" | 转人工 | 转人工,备注客户情绪 |
复杂需求 | "我需要同时安装空调、热水器和净水器,时间要协调" | 转人工 | 转人工,携带已采集信息 |
关键检查点:转人工时,AI采集到的信息(客户姓名、电话、地址、产品型号、期望时间)必须传递给人工坐席,客户不需要重复说一遍。
测试5:表单生成
AI完成信息采集后,能否自动生成标准的安装预约表单:
检查项 | 通过标准 |
字段完整性 | 包含客户姓名、电话、地址、产品型号、期望安装时间 |
字段格式正确 | 电话格式正确,时间格式标准 |
表单可查看 | 坐席在工单系统中能看到完整表单 |
测试6:工单回写
检查项 | 通过标准 |
工单创建 | 表单提交后自动创建工单 |
工单状态 | 工单状态正确(如"待派单") |
工单回写 | 工单信息回写CRM或业务系统 |
场景二:故障报修
场景描述
客户的家电出现故障,联系客服报修。AI需要识别保修意图,判断是保内还是保外,采集设备信息,创建报修工单。
测试用例清单
测试1:意图识别
测试用例 | 客户说法 | 期望识别结果 | 通过标准 |
标准表达 | "我的空调不制冷了,报修" | 故障报修 | 正确识别 |
口语表达 | "师傅,我家热水器打不着火了" | 故障报修 | 正确识别 |
半截话 | "冰箱坏了" | 故障报修 | 正确识别 |
带型号 | "我的KFR-35GW空调不制冷了" | 故障报修 | 正确识别,同时提取型号 |
关键检查点:客户的"报修"说法可能和"咨询"混在一起,比如"我家的空调不制冷了,是不是缺氟啊"——AI需要识别这是报修意图,而不是普通的咨询意图。
测试2:缺失字段追问
报修场景需要采集的字段比安装更多:
缺失字段 | 期望追问内容 | 通过标准 |
产品型号 | "请问您的空调是什么型号?" | 追问到型号 |
故障现象 | "具体是什么故障现象?" | 追问到具体描述 |
购买时间 | "请问您是什么时候购买的?" | 追问到购买时间,辅助判断保内保外 |
客户信息 | "请问您的姓名和电话是?" | 追问到姓名和电话 |
地址 | "请问您的地址是?" | 追问到地址 |
关键检查点:AI需要根据客户提供的购买时间,自动判断保内还是保外,并告知客户保修政策。
测试3:知识回答
测试用例 | 期望回答 |
"保修期是多久?" | 告知该型号的保修政策 |
"维修要收费吗?" | 判断保内保外后告知是否收费 |
"维修师傅什么时候能来?" | 告知维修派单流程和预估时间 |
关键检查点:保修政策类回答必须准确,涉及保内保外判断的,需要AI明确告知判断依据,不能模棱两可。
测试4:转人工
测试用例 | 期望行为 |
故障复杂无法判断 | 转人工,携带故障描述和已采集信息 |
客户情绪激动(多次故障) | 转人工,备注投诉倾向 |
客户要求指定工程师 | 转人工,携带客户要求 |
测试5:表单生成
报修表单需要包含的字段:
字段 | 说明 |
产品型号 | 客户提供或系统查询 |
故障描述 | 客户描述的关键词 |
保内/保外 | AI自动判断 |
客户姓名 | 采集 |
联系电话 | 采集 |
地址 | 采集 |
期望上门时间 | 采集 |
测试6:工单回写
检查项 | 通过标准 |
工单类型 | 正确创建为"报修工单" |
工单优先级 | 根据故障类型自动判断优先级 |
工单分配 | 按区域分配到对应工程师 |
回写CRM | 报修记录写入客户档案 |
场景三:投诉受理
场景描述
客户对产品、服务或工程师不满意,投诉。投诉场景比报修更敏感,对AI的要求更高。
测试用例清单
测试1:意图识别
测试用例 | 客户说法 | 期望识别结果 | 通过标准 |
标准表达 | "我要投诉" | 投诉受理 | 正确识别 |
隐含表达 | "你们那个师傅态度太差了" | 投诉受理 | 正确识别 |
混合表达 | "我报修了三次都没人来,我要投诉" | 投诉受理 | 正确识别,同时识别超时背景 |
关键检查点:投诉意图识别最关键的是情绪感知。客户说"太差了""什么服务"这些词,AI需要能识别出投诉倾向,不能当作普通咨询处理。
测试2:缺失字段追问
投诉场景需要采集的信息:
缺失字段 | 期望追问内容 |
投诉对象 | "请问您要投诉的是哪个方面?产品质量还是服务?" |
具体事件 | "请您描述一下具体经过" |
涉及订单/工单 | "方便提供一下您的订单号或工单号吗?" |
客户信息 | "请问您的姓名和电话是?" |
关键检查点:投诉场景追问时语气要温和,不能显得在审问客户。AI需要用"请您描述一下"而不是"请提供投诉对象"这样的生硬表达。
测试3:知识回答
投诉场景的知识回答和安装报修不一样,不是回答标准问题,而是安抚和引导:
客户说法 | 期望回答策略 |
"你们服务太差了" | 先道歉,再引导描述具体问题 |
"我要找你们经理" | 告知升级流程,转人工 |
关键检查点:投诉场景中,AI不要尝试解释或辩解,应该先道歉、再采集信息、转人工处理。
测试4:转人工
投诉场景转人工是最重要的环节。几乎所有的投诉最终都需要人工处理,AI的作用是采集信息并平稳转接。
检查项 | 通过标准 |
转人工触发 | 识别投诉后及时转人工,不要让AI反复安抚 |
上下文传递 | 投诉对象、事件描述、客户信息完整传递给人工 |
客户情绪标记 | 在工单中标记客户情绪状态 |
测试5:表单生成
投诉表单需要包含的字段:
字段 | 说明 |
投诉类型 | 产品质量/服务态度/维修质量/其他 |
投诉对象 | 产品/工程师/流程/其他 |
事件描述 | 客户描述的关键信息 |
涉及工单号 | 如果有历史工单,自动关联 |
客户信息 | 姓名、电话 |
客户情绪 | 平静/不满/愤怒 |
测试6:工单回写
检查项 | 通过标准 |
工单类型 | 正确创建为"投诉工单" |
工单优先级 | 投诉工单优先级高于普通报修 |
工单分配 | 分配到投诉处理专员 |
回写CRM | 投诉记录写入客户档案 |
验收测试的执行流程
第一步:准备测试数据
从真实服务记录中挑选20-30条典型客户对话,覆盖安装、报修、投诉三个场景,每个场景至少包含:
标准表达案例
口语表达案例
半截话案例
情绪案例
复杂案例(多个意图混合)
第二步:逐个场景测试
按上述六个维度,每个场景逐一测试。建议用表格记录每个测试用例的通过/不通过情况。
第三步:统计通过率
维度 | 建议通过标准 |
意图识别 | 准确率≥90% |
缺失字段追问 | 准确率≥85% |
知识回答 | 准确率≥90% |
转人工 | 成功率≥95% |
表单生成 | 字段完整率≥95% |
工单回写 | 成功率≥95% |
第四步:Badcase 复盘
不通过的测试用例,逐条分析原因:
是意图识别模型的问题?
是知识库内容不完整?
是流程编排有遗漏?
是接口对接有问题?
修复后,重新测试,直到达到通过标准。
验收测试的常见误区
误区一:只测标准问法
很多企业验收时只测"标准问法",比如"我要报修空调"。但真实客户说话五花八门,不测口语表达、半截话、模糊表达,上线后客户用自己习惯的方式问,AI识别不了。
误区二:只测FAQ,不测流程
测试只问"空调保修期多久"这种单轮问题,不测试多轮追问、表单生成、工单回写这些流程能力。结果是FAQ命中率很高,但真正跑业务的时候,流程断了。
误区三:不测转人工质量
测试了转人工会不会触发,但没测转人工时上下文能不能传递过去。结果客户转人工后,又要重新说一遍,满意度下降。
误区四:不测边缘情况
只测正常情况,不测极端情况:客户不说话、客户只发图片、客户打错字、客户用方言说。这些边缘情况,验收时想到了,上线后就不会踩坑。
智能家电智能客服上线验收,核心不是测"机器人能不能回答问题",而是测"真实业务场景能不能跑通"。安装预约、故障报修、投诉受理这三个场景覆盖了家电售后80%以上的服务请求,每个场景按意图识别、缺失字段追问、知识回答、转人工、表单生成、工单回写六个维度逐一测试,验收通过率才有参考价值。
合力亿捷在多个家电品牌的落地实践中,已经积累了这套验收测试框架。验收不是最后一关,而是上线前的质量门禁——验收通过不了,说明Agent在真实业务场景中还没有准备好上岗。如果验收阶段发现大量Badcase,可以从意图识别、知识库内容、流程编排和系统对接四个方向定位问题,修复后再测,直到跑通。
