从零开始构建企业级实时语音代理:技术教程
声音
2026-03-18 v2
摘要
我们提供了构建从头开始的企业级实时语音代理的技术教程。虽然 end-to-end 语音到语音模型最终可能为语音代理提供最佳延迟,但目前尚无可供自托管的完整 end-to-end 解决方案。我们对最近的候选方案 Qwen3-Omni 进行了三种配置的评估:其云端-only DashScope 实时 API 实现约702ms 的音频到音频延迟(支持流式),但不可自托管;其本地 vLLM 部署仅支持 Thinker(从音频生成文本,516ms),不支持 Talker(音频合成);其本地 Transformers 部署运行完整管道,但延迟为约146s——远远不足以实现实时。因此,级联流式管道(STT → LLM → TTS)仍是自托管实时语音代理的实用架构,也是本教程的焦点。我们构建了一个完整的语音代理,采用 Deepgram(流式语音识别)、vLLM-served LLMs 配合函数调用(流式文本生成)和 ElevenLabs(流式语音合成),实现了测量的首次音频延迟为 755ms(最佳情况 729ms),并支持完整的函数调用。我们以 9 章节的渐进式教程形式发布完整代码库,每个组件都有经过测试的可用代码。
引用
@article{arxiv.2603.05413,
title = {Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial},
author = {Jielin Qiu and Zixiang Chen and Liangwei Yang and Ming Zhu and Zhiwei Liu and Juntao Tan and Wenting Zhao and Rithesh Murthy and Roshan Ram and Akshara Prabhakar and Shelby Heinecke and Caiming Xiong and Silvio Savarese and Huan Wang},
journal= {arXiv preprint arXiv:2603.05413},
year = {2026}
}