中文

面向大规模单码本TTS LLMs的多奖励GRPO

声音 2025-11-27 v1 计算机视觉与模式识别

摘要

近期大型语言模型(LLM)的快速发展变革了文本到语音(TTS)合成,催生了以离散编解码器标记序列表示语音的自回归框架。在其中,单码本TTS LLMs凭借紧凑且可流式处理的架构,联合建模语义与声学集成。然而,尽管具有效率优势,这些模型常出现语调不稳定、说话者漂移及自然度下降的问题。为此,我们提出一种多奖励Group Relative Policy Optimization(GRPO)框架,直接优化单码本TTS LLMs的标记生成策略。除标准的可理解性和说话者相似性目标外,我们的设计集成了三个基于规则的奖励:用于时长一致性的长度惩罚、用于解码稳定性的熵正则化奖励,以及显式监督节奏的LLM注释语调对齐奖励。在该语调奖励中,外部推理LLM通过基于情境学习预测多个合理停顿结构,为GRPO训练提供符合人类偏好的监督信号。为评估通用性,我们进一步在GRPO优化的AR主干上附加流匹配(FM)解码器,观察到持续的额外提升,表明强化优化增强了内在AR策略。我们进一步进行了数据规模和模型规模的可扩展性分析,揭示该方法在单码本TTS LLMs中持续提升语调稳定性、说话者相似性及整体语音自然度。

关键词

引用

@article{arxiv.2511.21270,
  title  = {Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale},
  author = {Yicheng Zhong and Peiji Yang and Zhisheng Wang},
  journal= {arXiv preprint arXiv:2511.21270},
  year   = {2025}
}

备注

4 pages, 2 figures