中文

面向电信领域的低延迟端到端语音智能体:基于流式语音识别、量化 LLM 与实时语音合成

声音 2025-08-08 v1 人工智能 音频与语音处理

摘要

我们提出了一个面向电信领域的低延迟语音智能体管道,支持实时、交互式的电信场景应用,为呼叫中心自动化、智能 IVR (Interactive Voice Response) 以及 AI 驱动的客户支持提供先进语音 AI 能力。该解决方案由 NetoAI 开发,集成四个专业模型:TSLAM,一款 4 位量化的电信专用大语言模型 (Telecom-Specific Large Language Model, LLM);T-VEC,电信专用嵌入模型;TTE,电信专用自动语音识别 (ASR) 模型;以及 T-Synth,电信专用语音合成 (TTS) 模型。这些模型使智能语音助手能够实现高度响应、领域适配的语音交互,支持低延迟下的知识驱动式语音交互。管道整合了流式 ASR (TTE)、对话智能 (TSLAM)、对电信文档的检索增强生成 (RAG) 以及实时 TTS (T-Synth),树立了电信语音助手的新基准。为评估该系统,我们构建了一个包含 500 份人工录制电信问题的 数据集,模拟真实电信智能体查询。该框架允许对整个管道中的延迟、领域相关性和实时性能进行分析。结果表明,TSLAM、TTE 和 T-Synth 的实时因子 (RTF) 均低于 1.0,支持企业级、低延迟的电信部署。这些由 TSLAM、TTE 和 T-Synth 驱动的 AI 语音助手为下一代电信 AI 提供了基础,实现自动化客户支持、诊断等功能。

关键词

引用

@article{arxiv.2508.04721,
  title  = {Toward Low-Latency End-to-End Voice Agents for Telecommunications Using Streaming ASR, Quantized LLMs, and Real-Time TTS},
  author = {Vignesh Ethiraj and Ashwath David and Sidhanth Menon and Divya Vijay},
  journal= {arXiv preprint arXiv:2508.04721},
  year   = {2025}
}