大模型正在快速提升智能语音机器人的理解和生成能力。但当大模型真正进入企业电话场景,仅仅能够听懂问题、生成答案还不够。
真实通话不是轮流完成的标准问答。客户会停顿、插话、改口,会分段报出电话号码、订单号和设备型号。机器人不仅要知道客户说了什么,还要持续判断客户是否已经说完、是否真的要打断、已经听到了哪些内容,以及接下来应该进入哪个业务环节。
这意味着,智能语音机器人的能力重心正在发生变化:从识别和回答单句话,转向理解整通电话的实时状态,并保持对话与业务的连续性。
围绕这一变化,合力亿捷推出 SmartVoice 智能语音服务,并持续升级 Synerow 客户联络Agent 中的电话Agent能力。Synerow 集智能体与构建运营平台于一体,电话Agent 是其在语音场景的落地,在线客服Agent 则覆盖文字场景,形成在线+语音一体化的客户联络能力。
SmartVoice 将合力亿捷长期积累的语音增强、轮次判断、响应控制、打断处理和语音上下文管理等能力进行统一服务化,为电话Agent提供实时语音交互能力;Synerow 负责将通话中获得的信息继续带入知识、工具和企业系统。

这次能力升级的重点,不是增加几个孤立的语音功能,而是完成三个层面的连接:从声音识别到表达状态判断,从模型生成内容到双方真实共享的上下文,再从语音对话进入业务执行。
一、从听清内容,到理解客户的表达状态
把客户的话听准,是一通电话顺利进行的基础。
真实客服电话可能伴随环境噪声、非人声和远处人声,也会出现大量品牌名称、产品型号、设备部件和行业术语。一处专业词识别错误,就可能使后续意图判断和业务流程整体偏离。
SmartVoice 在基础语音识别之外,对声音进行降噪和非目标声音过滤,并结合行业词库对容易混淆的专业词进行增强和修正。但获得准确的文字,只解决了“客户说了什么”。电话Agent还需要判断“客户是否已经说完”。
客户在报电话号码、订单号或描述复杂故障时,经常会在一句话中自然停顿。如果系统只根据声音是否停止决定接话时机,就容易在客户尚未表达完整时提前回应。
SmartVoice 将声音活动检测与表达结束判断结合起来,不只判断客户有没有停止发声,还进一步判断这一轮意思是否已经表达完整,再决定继续等待还是进入下一步响应。由此,机器人的判断方式从“声音停了,可以接话”升级为“客户的意思表达完整了,可以进入下一步”。
获得更准确的接话时机后,系统还可以提前准备后续回应;需要查询业务系统时,也可以先给出及时反馈,减少通话中的沉默和冷场。
这项能力的价值不只是让对话听起来更像真人,更重要的是避免一段尚未完成的信息被提前带入业务。

二、从支持打断,到维护双方真实共享的上下文
客户插话时,系统首先要判断客户是否真的想打断。
“等等”“不是这个意思”通常代表明确打断;“嗯”“好的”则可能只是正常回应。如果检测到任何声音都立即停止,通话会被频繁切断;如果完全不允许插话,又会让客户失去交流主动权。
SmartVoice 综合声音活动、识别文本、语义和特定表达,判断客户是否真正发起打断。
因此,打断处理不再只是检测“有没有声音”,而是理解“这个声音在当前对话中代表什么”。
打断发生后,另一个更重要的问题随之出现:下一轮对话记住的内容,是否与客户实际经历的通话一致。
如果机器人已经生成三句话,但客户听完第一句便插话,后两句话实际上没有播放。如果下一轮模型仍然把三句话全部视为已传达信息,就可能基于客户从未听到的内容继续交流。
SmartVoice 根据实际播报状态维护语音上下文。只有真正播放给客户的内容,才会成为后续对话的依据。
模型记录的内容由此从“机器人生成过什么”升级为“客户真正听到了什么”。
在此基础上,Synerow 电话Agent近期进一步增加了三项状态处理能力:
· 客户停顿后继续补充、造成前后输入重复时,可以撤回上一次输入及相应的对话记录;
· 机器人被打断时,系统记录内容实际播放到的位置,帮助Agent判断接下来应该补充、解释还是进入新的问题;
· 对于转人工等不能被普通插话破坏的关键节点,可以设置节点不可打断,避免流程错误跳转。
这些能力共同解决的不是“机器人能不能停下来”,而是客户停顿、补充、插话或改口以后,机器人能否继续保持正确的对话状态。

三、从语音对话,进入真实业务执行
保持正确的通话状态,最终是为了让客户表达的信息能够继续进入业务。
客户提出订单查询,电话Agent需要调用订单系统;客户预约安装,需要继续确认产品型号、地址和时间;客户提出设备报修,则要采集故障信息并创建工单。
SmartVoice 负责让电话Agent准确获得客户表达和实时通话状态;Synerow 则负责连接知识库、业务流程、工具和企业系统,把已经确认的信息转化为下一步行动。
对于步骤明确的业务,企业可以为电话Agent配置固定流程,执行查询、预约、工单创建和结果通知等操作。
对于步骤不完全固定的任务,Synerow 在Agent执行层增加了 ReAct 执行方式。企业可以通过 Skill 设定任务目标、工作流程、可调用工具、风险规则和输出要求,由Agent在授权范围内动态决定下一步行动。
同时,企业可以配置最大行动步数、单步超时时间和工具失败重试次数,使动态执行始终处于可控边界内。
业务执行方式由此从“按照预设步骤逐项流转”扩展为“在企业设定的目标、规则和权限内动态行动”。
需要人工介入时,已经获取的客户信息、对话内容和办理进度可以继续交给坐席,减少客户从头说明。机器人尚未播报完关键信息时,系统也可以通过短信补充未完整传达的内容。
以乐岛海洋王国为例,开园季游客咨询量激增,电话Agent承担票务咨询、营业时间、购票指引等高频来电,SmartVoice 的表达状态判断和打断处理使对话更接近真人坐席,高峰期人工坐席压力显著降低。
一通智能语音电话由此不再停留在“客户提问 → 机器人回答”,而是形成一条连续链路:客户自然表达 → 判断实时状态 → 形成正确上下文 → Agent进入业务 → 调用系统执行 → 反馈处理结果。

四、从单点能力,走向整通电话的连续协同
智能语音机器人的能力优势,不能只用识别准确率、响应速度或是否支持打断来衡量。
真正进入企业生产场景后,机器人需要同时做到:
· 不只听到声音,还能判断客户是否表达完整;
· 不只支持打断,还能理解什么时候应该被打断;
· 不只记录生成内容,还能保持与客户真实经历一致的上下文;
· 不只回答问题,还能把已经确认的信息继续带入业务。
SmartVoice 的价值,是让这些能力围绕同一通电话连续协同;Synerow 则将正确的对话状态进一步转化为可以执行的业务任务。
合力亿捷深耕客户联络领域二十余年,长期服务电话、在线等不同企业客户服务场景。SmartVoice 的推出,是合力亿捷在实时语音场景中的进一步深化,也是 Synerow 持续完善多渠道客户联络Agent能力的一部分。
从听懂一句话到接好一通电话,智能语音机器人需要处理的不只是声音,还包括整段交流与业务执行之间的连续关系。
---
关于合力亿捷
合力亿捷(新三板上市,股票代码:833629),客户联络Agent与智能客服解决方案提供商。其自研的Synerow客户联络Agent支持企业持续创建和运营面向客户服务、营销触达、坐席协同与运营管理的数字员工,产品覆盖电话Agent、在线客服Agent,并可与智能呼叫中心、工单、智能质检等系统协同。合力亿捷支持SaaS、混合云和私有化部署,服务从小微企业到大型集团超万家企业。
