随着语音交互技术持续落地,智能外呼已经成为很多业务场景的沟通载体。在一通外呼通话里,机器人需要和客户完成多轮对话,并且从客户零散的口头表达中,判断对方是否存在业务意向。过去依靠关键词匹配的识别方式,很容易受到口语化表达、歧义语句干扰,识别稳定性不足。大模型的引入,改变了意向识别的实现路径。本文从业务痛点切入,逐层解析大模型如何完成客户意向识别,说明整套判定体系的运行逻辑与实现细节。

00innews通用首图:全渠道客服系统.jpg

 一、提出问题:智能外呼意向识别面临的现实难题

 1.1 外呼对话本身存在天然复杂性

电话沟通属于实时语音交互,客户表达具备很强的口语特征。语句语序随意,存在大量停顿、重复、语气词,还有省略句式。同一类意向,客户可以用几十种不同话术表达;反过来,同样一句话,在不同上下文里,意向含义会完全不同。

传统识别方案大多基于关键词、正则规则进行匹配。规则库只能覆盖预先录入的语句模式,一旦客户跳出预设话术,系统就无法正确捕获意图。当客户表达模糊、带有犹豫情绪时,关键词匹配只能识别字面文字,无法读懂背后潜在态度。

 1.2 意向判定不是简单二元选择

很多人会简单理解意向识别就是区分“有意向”和“无意向”。真实业务场景中,客户意向是连续梯度状态,并非只有两种结果。除明确意向、明确拒绝之外,还存在暂缓考虑、索要资料、询问细节、质疑信息、暂时没空等中间状态。

不同意向等级对应的后续处置策略完全不一样。如果识别模型只能输出二元结果,会造成大量客户分类偏差,后续流转策略失效。传统规则体系很难精细化划分多层级意向,规则维护成本会随着业务复杂度提升快速上涨。

 1.3 语音转写误差会传导至意向识别环节

外呼机器人接收的原始输入是音频流,需要先经过语音转写模块,把语音转换成文本。转写过程会产生错别字、断句错误、漏字。这些错误文本作为下游识别模块的输入,会直接干扰意向判断。

传统关键词识别对转写错误容错能力弱,少量文字偏差就会触发错误规则匹配。在嘈杂通话环境、口音差异场景下,误识别概率会进一步放大。这也是早期智能外呼系统意向识别效果不稳定的核心因素之一。

 1.4 上下文记忆缺失,割裂对话完整逻辑

一通外呼通话是多轮连续对话,客户单句回答需要结合前文机器人提问、客户之前表述综合解读。基于关键词的识别方式大多是单句独立判断,缺少对话上下文的关联理解能力。

客户在对话前期表达疑问,后期给出答复,单独截取某一句话,很容易误判意向。缺少上下文关联能力,系统无法理解客户态度变化,只能孤立看待每一句对话内容,造成意向判定失真。

 二、分析问题:传统意向识别方案底层逻辑与局限

 2.1 关键词与正则匹配的工作机制

关键词匹配属于浅层文本处理方式。技术人员梳理业务场景内各类意向对应的词汇、短语,构建词库与匹配规则。当转写文本命中预设词汇,系统就触发对应意向标签。正则表达式则用来匹配固定句式结构,扩大规则覆盖范围。

这套机制优势在于逻辑简单,上线初期调试速度快,可解释性较强。规则触发之后,可以直接定位是哪一个关键词命中,方便人工排查问题。

但短板同样突出。规则只能识别字面符号,不具备语义理解能力。同义词、转述表达无法自动识别,需要人工持续扩充词库。业务场景变更,就要大批量修改规则,维护工作量持续增加。歧义语句无法分辨语境,容易出现误判。

 2.2 机器学习分类模型的能力边界

在大模型普及之前,行业普遍使用传统机器学习文本分类模型做意向识别。流程是先收集大量通话转写文本样本,人工标注意向标签,完成数据集构建。对文本做分词、特征提取,将文字转化为向量,送入模型训练,学习文本特征和意向标签之间的映射关系。

相比关键词规则,机器学习模型可以识别同义词,具备基础语义特征提取能力,不需要人工逐条编写句式规则。不过模型能力上限由标注数据集决定,样本没有覆盖到的表达形式,识别效果下降。

这类模型属于判别式模型,输入文本之后直接输出分类标签,不擅长处理长对话上下文。输入文本长度存在限制,长通话对话需要截断内容,丢失部分上下文信息。模型无法自主推理,面对全新话术泛化能力不足。

 2.3 两种方案共同存在的核心短板

关键词规则、传统机器学习模型,本质上都是对文本表层特征进行捕捉,缺少对自然语言深层语义、逻辑关系的理解能力。二者都难以处理模糊表达、反问句式、含蓄表达。

意向标签体系扩展困难,新增意向分类,需要补充标注样本或者新增大量规则。模型输出结果缺少推理过程,出现错误判定时,定位根因难度较高。面对客户在对话过程中态度动态变化,无法持续跟踪意向演变。

这些局限,推动行业开始引入大模型,重构智能外呼的意向识别链路。

 三、解决问题:大模型意向识别底层原理

 3.1 大模型基础语义理解能力原理

大模型依托海量文本数据完成预训练,学习人类语言的语法、语义、常识逻辑、表达习惯。模型将输入文本转化为向量表征,捕捉词语之间、句子之间的关联关系,实现语义层面理解,不局限于文字表面匹配。

在智能外呼场景,模型接收的输入不再是孤立单句,而是整段对话上下文。模型可以理解代词指代、省略语句、转折逻辑,读懂客户话语背后真实想法。面对同义不同表述的语句,能够识别语义一致性,不需要人工维护庞大词库。

大模型具备自然语言推理能力,可以基于对话内容做逻辑推导。当客户表达比较含蓄,没有直接出现意向相关词汇,模型结合上下文推理,判断潜在意向倾向。

 3.2 外呼场景大模型意向识别完整链路

完整识别链路分为多个串联模块,依次完成处理。

第一阶段:音频采集与语音转写。通话音频持续送入语音识别模块,实时生成文本,输出对话双方的逐句内容,标注说话人区分机器人话术与客户应答。转写模块会附带置信度信息,标记文本识别不确定片段,供下游模块参考。

第二阶段:对话上下文组装。系统持续缓存本轮通话全部对话内容,按照对话时序拼接,形成完整对话上下文窗口。控制文本长度,匹配大模型输入上下文窗口上限,保证关键对话信息不会被截断。

第三阶段:提示词工程约束。通过提示词设定识别任务边界,定义意向标签体系、各标签判定标准、输出格式。提示词会明确告知模型,需要基于全部对话内容,而不是单句话进行判断,同时规定需要输出意向等级、意向判定依据。

第四阶段:大模型推理计算。模型读取上下文与任务指令,执行语义理解与逻辑推理,输出意向判定结果、对应置信分数,以及支撑该判断的对话原文片段。

第五阶段:后处理与结果校验。模型原始输出送入后处理模块,做格式解析、异常结果过滤、置信度阈值判定。低于阈值的结果,标记为无法判定,交由人工复核,不直接进入业务流转。

第六阶段:结果落地与数据回流。意向标签同步到业务系统,驱动后续外呼动作,例如机器人切换话术、结束通话。通话文本、模型识别结果、人工复核结果回流,形成数据集,用于后续模型微调优化。

 3.3 基于大模型的意向标签分级逻辑设计

大模型意向识别不再局限二元标签,采用梯度化意向标签体系。标签划分依据客户的行动意愿、信息诉求、抵触程度。标签体系需要在提示词内明确定义,让模型掌握每个意向等级对应的客户行为特征。

高意向:客户主动咨询业务细节,询问办理流程、所需材料、时间安排,主动提出后续对接需求。

中等意向:客户没有明确拒绝,提出疑问,索要相关资料,表示会在指定时间考虑。

低意向:客户仅简单倾听,没有提出问题,表达暂时没有需求,但不排斥后续联系。

无意向:客户明确表达拒绝,说明自身不存在相关需求,要求停止致电。

待确认:客户表达模糊,信息不足,无法判定意向倾向。

每一类标签,都配套清晰判定标准。模型输出标签时,同时给出判定依据,方便后续核验。标签体系可以根据业务需求扩展调整,调整标签定义,仅需要修改提示词,不需要大规模重新标注训练样本。

 3.4 上下文窗口机制在多轮外呼对话中的作用

多轮外呼对话里,客户的意向会随着对话推进发生变化。上下文窗口机制,就是让模型能够读取历史对话,理解客户态度变化过程。

在对话进行过程中,系统持续把历史对话送入模型。模型可以理解客户前期疑问,和当前回答之间逻辑关联。例如客户前期询问业务范围,后续表示暂时不需要,模型结合完整对话,判断属于暂缓考虑,而不是直接判定无意向。

上下文窗口存在长度上限。通话轮次过多,文本长度超出窗口限制,就需要做文本摘要压缩。由大模型对早期对话内容生成精简摘要,保留关键意向信息,减少文本占用长度,保证核心信息不丢失。摘要压缩会设置策略,优先保留客户表达态度、关键疑问内容,过滤重复无意义语句。

 3.5 微调对齐:让大模型适配外呼领域专属知识

基础通用大模型掌握通用语言能力,但不熟悉外呼业务领域话术、行业专有表述。直接使用通用模型,容易出现意向判定偏差。因此需要通过领域微调,让模型适配外呼场景。

微调阶段,使用历史真实通话文本+人工标注意向标签组成数据集。训练过程不改动模型底层基础架构,调整模型参数,学习业务场景下客户表达习惯,掌握场景内意向判定规则。

微调之后,模型在对应业务场景识别稳定性提升。微调数据集需要保证样本多样性,覆盖不同客户表达风格、各类意向状态、转写错误样本。数据集质量直接影响模型落地效果。

除全参数微调之外,行业也会采用轻量微调方案,降低训练算力消耗,缩短迭代周期。轻量微调只训练模型部分参数,保留基础模型能力,同时学习场景专属知识。

 3.6 置信度机制,管控意向识别输出质量

大模型输出意向标签时,同步输出置信度数值,代表模型对本次判断结果的确信程度。置信度来源于模型推理过程中,不同意向标签概率分布。

业务系统设置置信阈值。模型输出置信度高于阈值,意向标签直接采信;低于阈值,判定结果不可靠,标记为待复核,通话记录推送人工处理。

置信度机制可以降低误判带来的业务影响。遇到客户表述矛盾、转写错误较多、信息不足的通话,模型会给出低置信结果,避免强行输出意向标签。

 四、落地层面:大模型意向识别的干扰因素与应对方案

 4.1 语音转写误差带来的干扰与处理策略

语音转写是上游环节,转写错误会传递到大模型,影响语义理解。应对方式分为前端优化和模型侧兼容。

前端优化:优化语音识别模型,提升嘈杂环境、口音场景下转写准确率;输出文本附带每个片段识别置信度,标记识别不确定文字。

模型侧兼容:在提示词中告知模型输入文本可能存在转写错别字,要求模型结合上下文,修正合理范围内文字错误;遇到无法修正的文本片段,降低判定置信度,不强行给出意向标签。

 4.2 客户情绪化表达、反问语句的识别处理

通话过程客户会出现质疑、吐槽、反问等表达。这类语句字面带有否定词汇,但不一定代表无意向。传统关键词方案很容易误判。

大模型依靠语义推理,区分情绪表达和真实意向。模型读取完整上下文,判断客户是单纯提出质疑,还是直接拒绝业务。提示词中明确区分情绪词汇和意向判定依据,不以负面词汇直接判定无意向,重点看客户核心诉求。

 4.3 长对话场景下上下文丢失风险控制

通话轮次持续增加,对话文本总量不断变大,超出模型上下文窗口容量。如果直接截断对话,前期关键信息丢失,意向判断出现偏差。

主流处理方案分为两种。第一种是滑动窗口,保留最近N轮对话,更早对话做摘要处理。第二种是对话摘要,每间隔固定轮次,调用模型对历史对话生成摘要,压缩文本长度,保留客户核心观点、意向倾向。

摘要生成需要控制精度,不能丢失关键信息。摘要只压缩冗余语句,客户关键提问、态度表述必须完整保留。

 4.4 模型幻觉问题在外呼意向识别场景的防控

大模型存在幻觉现象,在信息不足时,凭空生成不存在的对话内容,以此支撑意向判断。在外呼场景,幻觉会造成意向标签错误,带来业务损失。

防控手段分为多层。第一,提示词约束,明确要求模型只能依据给定对话文本进行判断,不允许引入对话以外信息。第二,强制要求模型输出判定依据,依据内容必须来自对话原文,便于校验。第三,增加结果校验规则,当模型判定依据和对话原文不匹配时,直接标记结果无效。第四,持续回流数据,发现幻觉样本,补充进微调数据集,迭代优化模型。

 五、模型效果迭代体系:持续优化意向识别能力

 5.1 样本数据回流机制

外呼业务持续产生通话数据,形成源源不断样本来源。通话结束之后,系统保存对话文本、模型输出意向标签、后续业务行为结果。人工抽取样本复核,标注模型识别对错,构建增量训练数据集。

样本筛选需要兼顾各类意向比例,避免数据集样本分布失衡。如果数据集里面无意向样本占比过高,模型容易偏向判定客户无意向。需要持续补充各类意向样本,维持样本分布均衡。

 5.2 效果评估指标体系

评估意向识别模型效果,不能只看单一指标,需要多个指标综合衡量。

精确率:模型判定为某类意向的样本中,真实属于该意向的占比,衡量结果准确程度,减少误判。

召回率:真实属于该意向的样本里面,模型正确识别的占比,避免漏识别客户意向。

F1分数:综合精确率与召回率,衡量模型整体识别能力。

待复核占比:模型输出低置信结果的通话占比,反映模型遇到无法判定场景的处理能力。

不同业务目标,指标侧重点不一样。如果业务希望减少误触达,优先保障精确率;如果希望尽可能挖掘潜在客户,侧重提升召回率。

 5.3 迭代优化流程

模型迭代是循环流程。第一阶段,收集周期内通话样本,人工标注核验,统计评估指标,定位识别错误案例。第二阶段,归类错误类型,区分是转写问题、上下文不足、领域知识缺失还是幻觉问题。第三阶段,对应选择优化手段,调整提示词、补充微调样本、优化摘要策略。第四阶段,优化完成之后,使用测试集评估模型效果,指标达标再上线。上线之后继续监控指标,开启新一轮循环。

 六、大模型意向识别与传统方案对比,以及能力边界说明

 6.1 能力差异对比

关键词规则方案,擅长简单直白语句识别,可解释性强。面对多样化口语表达,泛化能力弱,维护成本高。传统机器学习模型,语义能力中等,需要大量标注样本,长对话处理能力有限。

大模型方案,语义理解、长上下文推理、模糊表达识别能力更强。新增意向类别,调整判定标准,改动成本更低。但大模型推理算力消耗更高,存在幻觉风险,对提示词设计、样本治理工作有更高要求。

 6.2 大模型意向识别存在能力边界

大模型不是可以解决所有识别问题。当通话音频质量极差,转写文本大量失真,即使大模型也无法完成准确判断。当客户表达信息极少,对话内容不足,模型只能输出待确认标签。

模型只能基于对话文本表达内容判断意向,无法获知客户通话之外想法。客户口头表达意向,后续发生想法变化,属于意向动态变化,不是模型识别错误。模型输出意向,代表通话过程中客户表达出来的倾向,不等于客户一定会完成后续业务动作。

意向识别是对对话信息的解读,预测结果存在概率属性,不存在百分百识别准确率。业务落地时,需要配套人工复核机制,对低置信通话进行二次处理。

 七、总结

智能外呼机器人判断客户意向,核心难点在于读懂口语化多轮对话背后客户真实态度。传统关键词、机器学习模型,受限于语义理解能力,很难应对复杂真实通话场景。

大模型意向识别,依靠预训练获得的语义推理能力,结合完整对话上下文,搭配提示词约束、领域微调、置信度管控、数据回流迭代整套体系,完成客户意向分级判定。整套链路包含语音转写、对话上下文管理、模型推理、结果校验、持续迭代多个环节,任何一个环节都会影响最终识别效果。

落地应用时,需要客观认识大模型能力边界。大模型提升意向识别的泛化能力,同时需要做好幻觉防控、转写误差兼容、样本治理等配套工作。意向识别模型不是一次性开发完成,需要持续收集通话数据,迭代优化,适配业务对话表达变化,持续稳定输出意向判定结果,支撑外呼业务流转。

合力亿捷语音机器人由大模型原生驱动,基于客服智能体平台与 Agentic Workflow 动态理解客户表达,覆盖电话语音+在线+工单全栈 Agentic 能力,尤其在语音对话交互与问题解决闭环上表现优异。