发布时间:2026-09-29 10:32:39
阅读量:22
标签:
容联云大模型产品负责人彭波发表《容联云端到端语音大模型的多行业落地实践》主题演讲,分享 Voice Agent 从技术能力走向规模化业务落地的最新实践。

传统语音机器人采用ASR+LLM+TTS 串联架构,多次模态转换不仅带来额外时延,也容易损失语气、情绪、节奏等原生语音信息。
基于Qwen-Audio-3.0-Realtime,模型可直接对语义、语气和情绪统一建模,首字延迟由约1.5秒降至500ms以内,为实时打断、全双工交互、情绪感知等能力提供更成熟的技术底座。
彭波表示,低延迟和拟人化只是端到端语音模型进入生产环境的起点。真正的企业级Voice Agent,需要持续完成感知、推理、策略生成、动态决策、工具调用与结果反馈。

为此,容联云构建“全维智能感知—策略预生成—实时动态博弈—情感计算决策—自主对话执行—持续学习进化”六步能力闭环,使 Voice Agent 能够围绕客户状态与业务目标动态调整策略。
大模型能够理解自然语言,却未必天然理解企业业务。订单、合同、工单、客户画像和经营指标分散在不同系统,仅通过API 连接模型与系统,并不能解决业务语义割裂的问题。
容联云的解法,是在Agent 与企业业务系统之间构建数据语义层(Semantic Layer),将业务实体及其关系、状态、规则和操作能力统一抽象,封装为Agent 可理解、可推理、可调用的业务对象。

基于数据语义层,Voice Agent 无需大规模搬迁企业数据,即可实时调用 CRM、订单、工单等系统,并通过 Function Call 完成查询、创建工单、修改订单、预约服务等操作,实现业务结果实时回写。
由此,Agent 从“回答问题”进一步走向理解业务、调用能力、执行任务。
面对复杂企业流程,容联云进一步将Voice Agent 引入多 Agent 协作体系。不同 Agent 可根据客户意图、业务阶段、情绪状态等进行级联转接,并自动传递完整上下文,实现复杂业务流程的连续编排。

一个人工可同时监测数十路Agent 通话,相关场景下人效提升10倍。
Voice Agent 也由单一联络工具,进一步成为企业业务流程中可独立运行的数字员工。
企业级Agent 的技术能力,最终要在生产环境中验证。
在某头部消费金融企业,容联云 Voice Agent 已自主承接逾期案件催收,日均自主通话量超过2万通,相比人工催收成本降低70%。
在某全国连锁餐饮品牌,Voice Agent 实现92%订单确认完成率、外呼成本降低60%。
在某头部电商平台,大促期间整体接待能力提升5倍。

面向未来,容联云将持续深化与阿里audio 的协同,推动端到端语音大模型与企业级 Agent 技术体系融合,让语音真正成为连接客户、业务系统与智能执行的新入口。
咨询热线
400-775-5500
客服在线时间
9:00-18:00
(其他时间为机器人客服)