DrVoice:通过双分辨率语音表示的并行语音-文本语音对话模型
计算与语言
2025-12-24 v4
摘要
近年来,利用大语言模型(LLMs)进行端到端(E2E)语音生成的研究吸引了社区广泛关注,多项工作将基于文本的 LLMs 扩展为生成离散语音 token。现有 E2E 方法主要分为两类:(1)独立生成离散语音 token 而不将其纳入 LLM 的自回归过程,导致文本生成无法感知并发的语音合成;(2)通过联合自回归建模生成交错或并行的语音-文本 token,从而在生成过程中实现跨模态感知。本文提出了 DrVoice,一个基于联合自回归建模的并行语音-文本语音对话模型,具有双分辨率语音表示。值得注意的是,当前方法主要使用 12.5Hz 的输入音频表示,而我们提出的双分辨率机制将输入频率降低至 5Hz,显著降低了计算成本,缓解了语音 token 和文本 token 之间的频率差异,从而更好地利用 LLMs 的能力。实验结果表明,DrVoice-7B 在 OpenAudioBench、VoiceBench、UltraEval-Audio 和 Big Bench Audio 等著名语音基准测试上建立了新的最先进(SOTA)性能,使其成为约 7B 参数规模下领先的开源语音基础模型。
引用
@article{arxiv.2506.09349,
title = {DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations},
author = {Chao-Hong Tan and Qian Chen and Wen Wang and Chong Deng and Qinglin Zhang and Luyao Cheng and Hai Yu and Xin Zhang and Xiang Lv and Tianyu Zhao and Chong Zhang and Yukun Ma and Yafeng Chen and Hui Wang and Jiaqing Liu and Xiangang Li and Jieping Ye},
journal= {arXiv preprint arXiv:2506.09349},
year = {2025}
}
备注
Work in progress