中文

面向语音自回归扩散模型的直接偏好优化

音频与语音处理 2025-09-24 v1

摘要

自回归扩散模型(ARDMs)近期被应用于语音生成,在零样本文本到语音中取得了最先进的(SOTA)性能。通过以下一 token 扩散的方式自回归地生成连续语音 token,这些模型为下一 token 预测提供了一种有前景的替代方案,避免了与离散语音 token 化相关的技术复杂性。作为一种相对新颖的范式,基于强化学习(RL)的语音 ARDMs 微调研究仍然有限。在本文中,我们提出自回归扩散-直接偏好优化(ARDM-DPO)以推进该研究。通过使用 DPO 微调最近提出的零样本文本到语音模型 DiTAR,我们在语音表现力和长文本鲁棒性方面取得了显著提升。

关键词

引用

@article{arxiv.2509.18928,
  title  = {Direct Preference Optimization for Speech Autoregressive Diffusion Models},
  author = {Zhijun Liu and Dongya Jia and Xiaoqiang Wang and Chenpeng Du and Shuai Wang and Zhuo Chen and Haizhou Li},
  journal= {arXiv preprint arXiv:2509.18928},
  year   = {2025}
}