中文

基于DiffRO方法的LLM驱动TTS系统可微奖励优化

声音 2025-07-09 v1 人工智能 音频与语音处理

摘要

本文提出了一种新的可微奖励优化(DiffRO)方法,旨在提高基于神经编解码器语言模型的文本到语音(TTS)系统性能。与传统用于TTS的强化学习从人类反馈(RLHF)方法不同,DiffRO直接基于神经编解码器标记计算奖励,而不依赖于合成音频。此外,我们采用 Gumbel-Softmax 技术使奖励函数可微,从而简化了RLHF训练过程。此外,我们引入了多任务奖励(MTR)模型,可以从不同角度提供反馈,并发现它可以增强系统有效遵循指令的能力。实验结果表明,DiffRO显著提高了TTS系统的发音准确性,在 seed-tts-eval 数据集上实现了最先进(SOTA)的 WER 结果。此外,随着 MTR 模型的集成,我们演示了能够以零样本方式控制情感和质量属性的能力。

关键词

引用

@article{arxiv.2507.05911,
  title  = {Differentiable Reward Optimization for LLM based TTS system},
  author = {Changfeng Gao and Zhihao Du and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2507.05911},
  year   = {2025}
}