人工抽检的覆盖率天花板
客服电话系统的质检,传统做法是人工抽检——质检员每天从录音库中抽取一定比例的通话,逐条听录音、对照评分表打分。这个做法的问题不在于质检员不够认真,而在于抽检比例本身有天花板:一个全职质检员一天能完整听完并评分的录音通常不超过 50 通,而一个 50 坐席的呼叫中心每天产生的通话量可能在 2000 通以上。即使配置 3 名质检员,覆盖率也仅约 7.5%。
低覆盖率带来的直接后果是:大部分服务问题永远不会被发现。一个坐席可能在某通电话中使用了不当话术、遗漏了关键合规提示、或者对客户情绪处理不当,但只要这通电话没被抽中,这些问题就不会进入管理视野。更麻烦的是,低覆盖率意味着质检结果缺乏统计意义——你无法从 5% 的样本中判断整个团队的服务质量趋势。
全量智能质检的逻辑不是"用 AI 替代质检员",而是让 AI 完成所有录音的初筛和标记,把质检员从逐条听录音中解放出来,聚焦在 AI 识别出的高风险、高价值通话上做深度分析。

第一步:录音转写——质检的基础工程
全量质检的第一步,是把电话录音变成可分析的文本。这一步看似简单,但有几个关键变量直接影响后续质检的准确性。
首先是转写准确率。客服电话场景中,影响转写质量的因素包括通话环境噪音、双方语速、方言口音、行业术语和产品名称。如果转写准确率低,后续基于关键词和语义的质检规则都会失效。合力亿捷通话 Agent 在客服对话场景中实测普通话 ASR 识别最高可达 98%,但实际部署中仍需根据客户行业、术语和典型通话环境做针对性优化。
其次是声道分离。电话录音中坐席和客户的声音混在同一音轨上,需要 VAD(语音活动检测)技术将双方语音分离,标记每句话的说话人。声道分离的错误会导致质检系统把坐席的不当话术归给客户,或者漏掉客户的关键投诉表达。
第三是转写结果的结构化。转写不仅是把语音变成文字,还需要把通话切分成有意义的段落——开场问候、需求确认、问题处理、解决方案、结束语——才能让质检系统在不同的通话阶段执行不同的检查规则。例如,合规质检需要在通话结束前检查是否有风险提示和确认话术,而不是在整个通话中模糊搜索关键词。
第二步:规则质检与大模型质检的双轨架构
转写完成后,质检系统进入实质检查阶段。目前主流的智能质检采用"规则质检 + 大模型质检"双轨架构,两者解决的问题不同,不能互相替代。
规则质检适合处理"确定性"的检查。例如:开场白是否包含标准问候语、是否按规范确认了客户身份、是否读了合规声明、是否在通话结束前完成了满意度回访。这些检查项有明确的文本模板可对照,规则质检可以做到高准确率、低误报。规则质检的优势是执行速度快、结果可解释、误报容易排查。
大模型质检解决的是规则质检够不到的问题——语义理解、情绪判断、风险识别。例如:坐席说的是"我理解您的不满",但整段对话的语气和上下文表明这只是机械话术,客户情绪并未被真正回应;或者坐席没有直接说错话,但暗示了超出授权范围的承诺。这些"灰色地带"的质检不能靠关键词匹配,需要大模型理解对话的上下文、语气和隐含含义。
合力亿捷的智能质检能力同时覆盖了规则质检和大模型质检两种模式。规则质检支持关键词、情绪、风险内容、服务流程和话术规范检查;大模型质检可从语义层面识别投诉风险、服务断点和客户情绪变化。在实际部署中,两类质检不是先后关系,而是并行运行——规则质检快速筛选确定性违规项,大模型质检标记需要人工复核的疑似风险项。
第三步:从评分到风险识别
传统质检的核心产出是评分——每通电话一个分数,月底汇总成坐席的质检得分。全量智能质检的价值不止于评分,更在于风险识别。
风险识别有几个典型方向。投诉风险识别:通过关键词和情绪分析,识别出客户表达了强烈不满、要求升级处理、或提及"投诉""曝光""监管部门"等风险信号的通话,优先推送质检员复核。合规风险识别:检查坐席是否遗漏了必要的合规声明,是否在未经授权的情况下给出了承诺或判断。服务断点识别:找出客户反复追问同一问题、坐席多次转接、或通话中长时间等待的录音,这些往往是知识库不完善、流程不合理或系统支持不足的信号。
合力亿捷的质检与 VOC 能力支持将识别结果与呼叫中心、在线客服和工单系统联动。例如,一通被标记为"投诉风险"的通话,系统可以自动关联到该客户的工单记录和服务历史,让质检员在复核时看到完整的服务上下文,而不是孤立地听一段录音。
第四步:从质检结果到问题定位
质检的最终目的不是打分,而是找到问题根因。全量质检提供了比人工抽检更大的样本量,使得问题定位从"感觉"变成"数据"。
高频问题定位:全量分析后可以发现,哪些问题在通话中被反复提及、哪些问题的转人工率异常高、哪些场景下坐席的回答一致性差。如果 30% 的通话中客户都在问同一个产品功能,但坐席的回复各不相同,说明知识库中这个功能的解释不够清晰或不够统一。
知识缺口识别:大模型质检可以分析坐席回答与标准知识库的偏离程度,识别出哪些问题没有标准答案、哪些答案被坐席频繁修改。这些信息可以直接反馈给知识库运营团队,推动知识更新。合力亿捷的悦问知识库可与质检和 VOC 联动,根据高频问题、错误回答、客户反馈和 Badcase 补充或修正知识。
坐席能力画像:全量质检可以生成每个坐席的能力画像——哪些质检项得分稳定、哪些项波动大、哪些类型的通话容易出问题。这比"每月抽 20 通电话打分"的评估方式更接近真实表现,也能为坐席辅导和培训提供更精准的方向。
从质检到运营闭环
全量智能质检的价值,只有在形成"质检 → 分析 → 改进 → 复检"的闭环后才能体现。如果质检结果只是每月出一次报告、开会读一遍,然后流程和知识都不变,那全量质检只是把"抽 5% 打分"变成了"全量打分",没有解决根本问题。
一个可运作的运营闭环通常包含四个环节:质检发现(规则和大模型并行标记问题通话)→ 问题分析(按类型、坐席、场景归因问题根因)→ 改进动作(更新知识库、调整话术、修改流程、坐席辅导)→ 效果复检(下一周期观察同类问题的质检指标是否改善)。
合力亿捷的质检与 VOC 能力可以和呼叫中心、在线客服、工单、悦问知识库及 AI 原生工作台联动,让质检不只是"事后检查",而是融入坐席服务过程的辅助和反馈机制。比如,质检发现的共性话术问题可以沉淀到坐席辅助 Agent 的实时提示中;质检发现的投诉风险信号可以触发工单升级流程。
全量质检的边界与合规提醒
全量智能质检有几个需要明确的边界。第一,AI 质检结果不能替代合规终审和人工复核。对于涉及合规风险、投诉升级和重大服务事故的录音,质检员的专业判断仍然是最终依据。第二,质检覆盖范围取决于接入数据和规则配置。不是"系统一上线就能分析所有问题",需要根据企业的服务标准、合规要求和业务特点配置质检规则和评分体系。第三,质检的准确性需要持续校准。大模型质检的语义判断存在误报和漏报的可能,需要质检员定期复核 AI 标记结果,用反馈数据不断优化模型表现。
