大模型落地在线客服、电话客服等客户服务场景后,人机交互效率得到明显提升,但幻觉问题一直是制约规模化应用的核心障碍。模型会编造不存在的政策、服务条款、业务规则,给出与知识库相悖的答复,造成客户误解,增加人工复核成本。传统检索增强生成方案能够一定程度降低幻觉发生率,但在处理业务实体关联、复杂逻辑推理类客服问题时仍存在局限。RAG与知识图谱融合的技术路线,通过结构化知识与非结构化文档互补,约束模型生成边界,成为客服场景幻觉治理的重要方向。下文从问题成因、方案对比、融合架构、实施难点、优化策略几个层面展开完整分析。

一、提出问题:大模型客服场景下的幻觉是什么,带来哪些负面影响
1.1 客服场景幻觉的定义与表现形式
大模型幻觉,指模型在生成回复时,输出与真实业务知识不一致、无事实依据的文本内容。在客服业务场景中,幻觉可以划分为两类,一类是内在幻觉,模型本身参数记忆里的知识和企业真实业务规则冲突,模型优先调用预训练权重中的通用信息,忽略企业专属业务内容;另一类是外在幻觉,模型基于检索获取的文档片段,自行推演、捏造信息,生成原文不存在的结论。
在客服交互过程中,幻觉存在多种表现。实体信息失真,把业务对象、时间条件、资费标准、办理要求等关键信息篡改;逻辑推导错误,无法识别业务规则之间的约束关系,将互斥条件同时生效;信息遗漏或者过度延展,只截取知识库局部片段回答问题,或是在原文基础上延伸出不存在的业务权限。
客服场景的对话有强业务属性,用户提问往往围绕特定业务实体、规则限制、前置条件展开。这类问题对事实准确性要求很高,微小的信息错误,都会传导至业务流程,无法像通用聊天场景一样容忍模型错误输出。
1.2 幻觉给客服业务带来的多重影响
首先是客户体验层面。当模型输出虚假业务信息,客户会依据错误指引进行操作,操作失败后产生负面感受,拉长单次会话时长,引发更多咨询或者投诉行为。
其次是运营成本层面。为控制幻觉风险,企业需要配置人工坐席对模型回复进行审核,人工介入会抵消大模型降本增效的价值。幻觉问题频发时,还需要投入人力持续修正知识库、优化提示词,增加知识运维工作量。
最后是业务合规层面。金融、政务、通信等领域的客服对话内容受到监管约束,如果模型输出不符合业务规范、监管要求的答复,会带来合规层面的风险。
1.3 为什么客服场景幻觉更容易爆发
大模型本身的生成机制是概率文本预测,模型目标是生成通顺连贯的自然语言,而非保证内容事实正确,底层机制决定幻觉无法被完全消除,只能进行抑制。
客服场景还有自身特点放大幻觉风险。企业业务知识持续更新,产品政策、服务规则会定期调整,模型预训练知识存在时间滞后,无法自动同步最新业务文档。企业知识载体混合两种形态,大量业务资料是非结构化文档,包括说明文档、公告、会话纪要;同时业务内部存在大量实体、关系、规则,属于结构化知识,单纯文本很难表达实体之间的关联约束。
用户提问方式多样,口语化、省略式提问大量存在,用户经常省略部分前提条件,模型很容易丢失上下文约束,做出错误推断。多轮对话场景下,上下文窗口有限,随着对话轮次增加,历史信息丢失,也会诱发幻觉。
二、分析问题:单纯依靠RAG抑制幻觉的底层局限
2.1 RAG的工作原理与幻觉抑制逻辑
检索增强生成,核心思路是在大模型生成答案之前,先根据用户的问题向量,从企业文档库中检索相关的文本片段,把检索到的内容连同用户问题一起送入提示词,约束模型基于检索到的参考资料生成回答。
这套方案的核心假设:相关文档片段被检索命中后,模型就会参考文档内容,减少编造信息。RAG可以缓解参数知识带来的内在幻觉,让模型不再依赖预训练阶段学到的通用知识回答企业专属业务问题。但这套方案的约束能力存在边界,无法解决所有类型幻觉。
2.2 纯RAG方案在客服场景的短板
第一,文本检索只能匹配语义相似度,无法理解业务实体之间的逻辑关系。RAG处理的对象是碎片化文本段落,文档中的实体、属性、关联关系都隐藏在自然语言里。当用户问题需要多实体关联推理,例如多个业务条件叠加判断,单纯文本片段很难完整呈现全部约束,模型容易忽略实体之间的限制,出现逻辑类幻觉。
第二,检索存在噪声与召回偏差。检索阶段可能召回相似度高但是无关的文本片段,错误参考资料会引导模型生成错误内容;也会出现相关文档没有被召回,参考信息不足,模型自行编造内容补齐答案。向量检索基于语义向量,对实体名称、业务编码这类精准匹配场景,识别稳定性不足。
第三,碎片化文本容易造成知识割裂。一份业务规则会分散在多篇文档、多个段落中,RAG每次只召回局部片段。模型只能看到局部信息,看不到完整知识体系,当业务规则存在互斥、分支条件时,模型无法全局判断,容易断章取义。
第四,知识更新维护成本高。业务发生变更时,需要修改、新增大量非结构化文档,再重新做文本切分、向量化入库。文档碎片化管理,容易出现不同文档内容互相冲突,系统难以自动识别知识矛盾,冲突文档进入向量库之后,会持续诱发模型幻觉。
2.3 知识图谱单独使用的优势与不足
知识图谱以实体为基础,存储实体、实体属性以及实体之间的关系,用结构化图网络表达业务知识。知识图谱擅长精准查询实体信息、挖掘实体关联、表达规则约束。在客服场景,能够清晰存储业务对象、办理条件、互斥规则,支持多条件逻辑推理,弥补RAG在关系推理上的短板。
但知识图谱也存在明显局限。知识图谱构建成本较高,需要对原始业务文档做实体抽取、关系抽取,知识体量较大时,构建与更新的工作量显著提升。自然语言开放式问答场景,用户问题表述灵活多变,很多问题无法直接转化为图谱查询语句。单纯知识图谱无法处理长文本类、描述类问题,缺少自然语言生成能力,输出形式生硬,难以直接交付给客户。
综合对比能够看到,RAG擅长处理非结构化文本,适配开放式自然语言提问;知识图谱擅长结构化关系推理、实体校验。二者单独部署都无法全面解决客服场景幻觉问题,融合方案具备互补价值。
三、解决问题:RAG与知识图谱融合架构,抑制大模型客服幻觉
3.1 融合方案核心设计思路
RAG+知识图谱融合方案,核心思路是建立双知识源协同校验机制。以知识图谱承载结构化业务实体、关系、规则;以向量知识库承载非结构化业务文档。用户提问之后,同时触发两条知识检索链路,分别获取文本参考片段与图谱结构化事实。两条链路输出的内容共同送入大模型,同时增加事实校验环节,用图谱中的实体与关系约束模型生成,核查模型输出实体、关系是否符合业务事实,从源头减少编造信息。
融合架构不是简单并行两套独立系统,而是在多个环节打通数据流,实现知识互通、结果互检。整个流程分为知识层预处理、用户问题解析、双源检索、事实校验、模型生成、结果输出六个阶段。
3.2 知识层预处理阶段:分别构建向量知识库与业务知识图谱
知识预处理是整个方案的基础,分为非结构化文档处理流程和知识图谱构建流程,两条流程同源,保证两套知识库信息一致。
针对非结构化业务文档,执行文档清洗、分段、摘要提取,对文本块做向量化处理,存入向量数据库。分段策略需要适配客服问答场景,避免段落过长或者过短。段落过长会包含冗余信息,增加检索噪声;段落过短会割裂上下文,丢失完整业务条件。
针对同源业务文档,开展知识抽取工作。使用信息抽取模型,从文档中识别业务实体、实体属性、实体之间关系,识别业务规则、前置条件、互斥约束。抽取结果经过知识消歧、实体对齐、冲突检测之后,存入知识图谱。知识消歧用来处理同名不同含义的实体;实体对齐把不同文档里指代同一个对象的表述合并;冲突检测识别同一实体出现矛盾属性,标记待人工处理。
两套知识源保持关联映射,图谱中的实体可以关联到对应的原始文档片段,当图谱实体信息需要溯源时,可以快速定位对应的文本资料,方便后续知识运维。
3.3 用户问题解析阶段:意图识别、实体抽取、问题拆解
用户输入客服对话文本之后,系统首先进行问题解析。完成用户意图分类,识别用户咨询所属业务类别;同时从用户问句中抽取关键实体、属性、限定条件。
基于抽取得到的实体与条件,对用户问题做拆解。复杂多条件问题拆分为多个子问题,区分哪些问题适合文本检索,哪些问题适合图谱关系查询。系统生成两条查询指令,一条用于向量库做语义检索,一条转化为图谱查询语句,用于在知识图谱中查询结构化事实。
这一步可以降低检索链路的压力,避免把完整长句直接送入向量检索,减少无关内容召回。同时提前锁定问题核心实体,提升图谱查询的精准度。
3.4 双源并行检索阶段:向量检索与图谱查询同步执行
向量检索链路:使用拆解后的问题向量,在向量知识库检索top-k相关文本片段,对召回结果做重排。重排模型评估检索片段和用户问题的相关性,过滤低相关噪声文档,保留高质量参考文本。
知识图谱查询链路:将解析得到的实体、条件转化为图查询语句,在知识图谱中查询实体属性、关联实体、业务约束规则。图谱查询返回结构化事实三元组集合。
检索完成之后,对两个来源的信息做整合。把文本片段、图谱三元组整理成统一参考素材,同时对素材做精简,剔除重复信息,控制送入大模型的上下文总量,防止上下文过载。
3.5 事实校验环节:用知识图谱约束模型,拦截幻觉事实
事实校验是融合方案抑制幻觉的核心环节,也是和纯RAG方案最大区别。校验分为前置校验与后置校验。
前置校验,在把参考素材交给大模型之前,使用图谱数据校验检索文本中的实体与关系。如果文本片段描述的实体关系,和知识图谱存储的事实冲突,标记冲突内容,不送入模型,避免错误参考资料诱导幻觉。
后置校验,模型生成初步答复之后,系统从模型输出文本里抽取实体、关系,和知识图谱里的标准事实做比对。如果发现模型生成内容中的实体属性、业务关系和图谱不一致,判定存在事实错误,拒绝直接输出该回答,触发二次检索或者提示模型重新生成;严重情况下,转人工复核。
这套机制相当于给模型设置事实边界,模型不能随意编造不存在的实体、关系,所有输出的业务事实都需要经过结构化知识库核验。
3.6 模型生成与会话输出阶段,优化提示词约束策略
在提示词设计层面,明确告知模型生成规则。模型需要优先采信知识图谱提供的结构化事实,再参考检索文本片段;如果两个知识源信息存在差异,以知识图谱内的业务规则为准;当现有参考资料不足以回答用户问题时,禁止编造信息,直接告知当前无法解答,引导人工服务。
提示词控制模型输出风格,保持客服对话自然流畅,保留自然语言生成能力,不强制输出图谱三元组格式内容。同时维护多轮对话上下文,持续追踪对话中的实体信息,保证多轮交互过程实体状态不会丢失。
3.7 融合架构的两种部署模式
第一种是串行增强模式,以RAG为主,知识图谱为辅。向量检索拿到文本片段之后,从文本里抽取实体,调用知识图谱补充实体关联信息,丰富参考资料,再交给模型。适合业务规则以文档为主,实体关系复杂度中等的客服场景。
第二种是并行校验模式,双知识源独立检索,二者结果共同参与生成与事实校验,事实校验环节权重更高。适合业务逻辑复杂,大量规则存在实体关联、互斥条件的客服场景,幻觉抑制效果更强,对应的知识构建与算力开销更高。企业可以根据自身业务知识复杂度,选择适配部署模式。
四、落地实施过程中的关键技术难点
4.1 知识抽取与知识图谱构建的难点
从业务文档自动抽取实体和关系,抽取结果存在误差。业务文档表述不规范,大量业务规则隐藏在长句、条件复句内,自动抽取模型容易漏抽、错抽关系。抽取完成之后,实体消歧、实体对齐工作量大,业务术语、口语化别名很多,同一个实体有多种表达方式,系统识别难度较高。
知识图谱的质量直接决定事实校验效果,图谱本身存在错误数据,校验环节就会出现误判。知识图谱无法完全自动化构建,需要持续人工校验,知识体量越大,维护成本越高。
4.2 双知识源一致性维护问题
向量知识库和知识图谱由同源文档生成,但两套系统独立存储。业务发生变更,更新业务规则之后,需要同步修改向量文档和知识图谱。如果只更新其中一端,两套知识库信息不一致,会引发新的矛盾。
需要建立知识变更联动机制,当业务文档修改,系统自动触发两个动作:更新向量库对应的文本块;同时触发知识重新抽取,更新知识图谱内对应的实体与关系。同时定期做一致性巡检,自动比对两套知识库关于同一实体的描述,识别信息差异,标记待人工处理项。
4.3 复杂问题拆解与图谱查询语句生成的稳定性限制
用户客服提问句式灵活,存在口语化、省略、指代现象。把自然语言问题转化为图查询语句,转化准确率会直接影响图谱检索结果。转化失败时,图谱无法返回有效事实,系统退化为纯RAG方案,幻觉抑制能力下降。
针对这个问题,可以设置降级策略,图谱查询失败时,系统自动切换,依靠向量检索结果,同时提升提示词严谨程度,强化模型不知道就不编造的约束。
4.4 事实校验的边界问题
事实校验只能校验已经存入知识图谱内的实体与关系。对于全新业务实体、临时业务规则,图谱中没有对应数据,校验机制无法识别相关幻觉。同时校验只能核查事实类错误,很难识别语义层面细微偏差。
校验策略需要做分层处理,核心业务实体、关键规则强制校验;非核心描述性文本降低校验强度,平衡事实准确性和会话流畅度。
五、持续优化策略,降低幻觉水平,降低运维负担
5.1 分层知识治理,优化知识质量
将业务知识划分为核心规则知识、辅助说明知识。核心规则知识,例如办理条件、限制要求、实体属性,全部存入知识图谱,进入强制事实校验范围;辅助说明、介绍类文本,放入向量知识库。
定期开展知识清理,淘汰失效业务文档,合并重复内容,修正文档内矛盾描述。知识质量提升,是降低幻觉最基础手段,单纯依靠模型技术优化,无法弥补知识库本身错误带来的问题。
5.2 检索链路持续调优
向量检索环节,优化文本切分策略,针对客服问答的特点,以业务知识点为单位切分文档,而不是简单按固定字符长度分割。持续迭代向量模型、重排模型,提升相关内容召回率,减少噪声召回。
针对高频客服问句,建立问句样本库,持续评估召回效果,统计漏召回、误召回案例,反向优化向量库与查询策略。
5.3 迭代事实校验规则,完善幻觉识别能力
沉淀幻觉样本,对会话中出现的幻觉进行归类,区分实体错误、关系错误、逻辑推演错误。基于幻觉样本优化抽取模型和校验规则,提升系统识别幻觉类型的能力。
设置幻觉风险分级。高风险问题,涉及业务办理、费用、限制条件,开启完整双源检索+严格事实校验;普通咨询类问题,简化校验流程,平衡响应速度与准确性。
5.4 提示词与模型参数层面精细化管控
持续迭代提示词模板,强化模型的边界感知能力,反复明确模型不能编造业务事实。同时设置生成参数,适当调低采样随机性,减少模型自由发挥空间。
多轮对话场景下,做好会话实体状态追踪,维护对话状态,避免随着对话轮次增加丢失前置业务条件,防止上下文缺失诱发幻觉。
5.5 建立线上监控闭环机制
上线之后持续监控会话数据,搭建幻觉监测指标体系。统计会话中幻觉检出数量、幻觉类型、不同业务场景幻觉发生比例。当幻觉指标升高,自动告警,帮助运维人员定位问题来源,区分是知识库缺陷、检索召回问题还是事实校验模型缺陷。
收集模型拒绝回答的会话样本,分析无法回答的原因,补充完善知识库,持续扩大系统可覆盖问题范围。形成“线上会话采集-幻觉识别-根因定位-知识库/模型优化”的闭环迭代。
六、方案能力边界总结
RAG与知识图谱融合方案,可以有效抑制大模型客服场景下的实体错误、关系错误、逻辑推演类幻觉,相比单独使用RAG,事实校验能力更强,适合业务规则复杂、对答复准确性要求高的客服场景。但该方案不能彻底消除幻觉,幻觉源于大模型文本生成底层机制,任何技术方案只能降低幻觉发生概率,无法做到完全杜绝。
这套方案会带来更高的构建成本与算力开销,知识图谱的构建、双源检索并行运算、事实校验都会增加系统资源消耗。企业在选型落地时,需要结合自身业务知识规模、幻觉风险承受能力、运维人力储备综合评估。
从长期发展来看,大模型客服幻觉治理,不是单一模型层面优化,而是知识体系、检索策略、事实校验、会话管理多模块协同工作。结构化知识图谱与非结构化文档检索的融合思路,为客服场景大模型落地提供一条可行路径,通过对模型生成过程增加事实约束,平衡自然语言交互能力与业务答复准确性,推动大模型客服在更多业务场景稳定落地。
合力亿捷智能客服区别于在传统客服系统上外挂AI模块,从底层采用 Agentic 原生架构。基于客服智能体平台,支持自然语言描述自动生成对话流程,业务信息七个维度直接转化为可执行对话流;状态机+大模型双轨架构,决策路径可审计;支持豆包、通义千问、DeepSeek V4 等主流大模型按场景适配,不绑定单一供应商。
