X-Talk:模块化语音到语音对话系统的被低估潜能
声音
2025-12-23 v1
摘要
我们提出 X-Talk,一个开源框架,倡导 LLM 驱动语音到语音(S2S)系统的解耦式模块化设计。虽然主导趋势是采用端到端(E2E)建模以优化信息流,但这些“全能模型”往往难以在单一网络中平衡复杂语音任务的相互目标。X-Talk 通过证明系统优化的级联管道可在不牺牲模块化灵活性的前提下实现亚秒级延迟,挑战了这一范式。该框架无缝集成特定前端组件(如语音活动检测、语音增强)和多样化理解模型(如语音识别、情感识别、环境声分析),并与 LLM 能力集成,如检索增强生成(RAG)和工具使用。通过重拾级联方法,X-Talk 凸显了模块化 S2S 系统的被低估潜能,为未来研究和应用提供了稳健基础。
引用
@article{arxiv.2512.18706,
title = {X-Talk: On the Underestimated Potential of Modular Speech-to-Speech Dialogue System},
author = {Zhanxun Liu and Yifan Duan and Mengmeng Wang and Pengchao Feng and Haotian Zhang and Xiaoyu Xing and Yijia Shan and Haina Zhu and Yuhang Dai and Chaochao Lu and Xipeng Qiu and Lei Xie and Lan Wang and Nan Yan and Zilong Zheng and Ziyang Ma and Kai Yu and Xie Chen},
journal= {arXiv preprint arXiv:2512.18706},
year = {2025}
}
备注
14 pages