容联云亮相云栖大会,携手 Qwen Audio 推动语音智能落地

发布时间:2026-09-29 10:32:39

阅读量:22

标签:

近日,2026云栖大会「千问语音大模型」专题论坛举行。


容联云大模型产品负责人彭波发表《容联云端到端语音大模型的多行业落地实践》主题演讲,分享 Voice Agent 从技术能力走向规模化业务落地的最新实践。



端到端模型,正在重新定义语音 Agent


传统语音机器人采用ASR+LLM+TTS 串联架构,多次模态转换不仅带来额外时延,也容易损失语气、情绪、节奏等原生语音信息。


基于Qwen-Audio-3.0-Realtime,模型可直接对语义、语气和情绪统一建模,首字延迟由约1.5秒降至500ms以内,为实时打断、全双工交互、情绪感知等能力提供更成熟的技术底座。


彭波表示,低延迟和拟人化只是端到端语音模型进入生产环境的起点。真正的企业级Voice Agent,需要持续完成感知、推理、策略生成、动态决策、工具调用与结果反馈。


为此,容联云构建“全维智能感知—策略预生成—实时动态博弈—情感计算决策—自主对话执行—持续学习进化”六步能力闭环,使 Voice Agent 能够围绕客户状态与业务目标动态调整策略。


数据语义层,让 Agent 真正办成事情


大模型能够理解自然语言,却未必天然理解企业业务。订单、合同、工单、客户画像和经营指标分散在不同系统,仅通过API 连接模型与系统,并不能解决业务语义割裂的问题。


容联云的解法,是在Agent 与企业业务系统之间构建数据语义层(Semantic Layer),将业务实体及其关系、状态、规则和操作能力统一抽象,封装为Agent 可理解、可推理、可调用的业务对象。

这一思路与Palantir Ontology 的业务建模逻辑相近:模型不仅需要访问数据,更需要理解业务对象之间的关系,以及当前状态下可以执行什么动作。


基于数据语义层,Voice Agent 无需大规模搬迁企业数据,即可实时调用 CRM、订单、工单等系统,并通过 Function Call 完成查询、创建工单、修改订单、预约服务等操作,实现业务结果实时回写。


由此,Agent 从“回答问题”进一步走向理解业务、调用能力、执行任务。


多Agent协同,构建生产级执行体系


面对复杂企业流程,容联云进一步将Voice Agent 引入多 Agent 协作体系。不同 Agent 可根据客户意图、业务阶段、情绪状态等进行级联转接,并自动传递完整上下文,实现复杂业务流程的连续编排。

同时,智能协呼工作台形成“Agent扛量、人工扛质”的人机协同模式:Agent负责规模化触达和意图识别,人工聚焦高价值、高风险及复杂场景,并可随时一键接管。


一个人工可同时监测数十路Agent 通话,相关场景下人效提升10倍。


Voice Agent 也由单一联络工具,进一步成为企业业务流程中可独立运行的数字员工。


从模型能力,走向可衡量的业务结果


企业级Agent 的技术能力,最终要在生产环境中验证。


在某头部消费金融企业,容联云 Voice Agent 已自主承接逾期案件催收,日均自主通话量超过2万通,相比人工催收成本降低70%。


在某全国连锁餐饮品牌,Voice Agent 实现92%订单确认完成率、外呼成本降低60%。


在某头部电商平台,大促期间整体接待能力提升5倍。

目前,容联云Voice Agent 已覆盖金融、零售、电商、保险、教育、医疗等10+行业,累计通话量超千万次。


面向未来,容联云将持续深化与阿里audio 的协同,推动端到端语音大模型与企业级 Agent 技术体系融合,让语音真正成为连接客户、业务系统与智能执行的新入口。


咨询热线

400-775-5500

客服在线时间

9:00-18:00

(其他时间为机器人客服)

试用申请