中文

基于大语言模型的文本转语音的群组相对策略优化

音频与语音处理 2025-09-24 v1

摘要

本文提出了一种基于 GRPO 的方法,通过从现成的自动语音识别 (ASR) 模型中提取奖励,来增强基于大语言模型 (LLM) 的文本转语音 (TTS) 模型的性能。与以往用于基于 LLM 的 TTS 的强化学习方法相比,我们的方法不需要专门的模型来进行奖励计算或训练。此外,我们设计了一个复合奖励函数,将字符错误率 (CER) 与从 ASR 模型获得的负对数似然 (NLL) 相结合,提供了更具信息量和更准确的奖励信号。我们将 GRPO 微调应用于预训练的基于 LLM 的 TTS 模型,并评估了它们的零样本 TTS 性能。实验结果表明,所提出的方法显著提高了合成语音的可懂度和自然度。消融研究和进一步的分析证实了整合这两个奖励组件的有效性。

关键词

引用

@article{arxiv.2509.18798,
  title  = {Group Relative Policy Optimization for Text-to-Speech with Large Language Models},
  author = {Chang Liu and Ya-Jun Hu and Ying-Ying Gao and Shi-Lei Zhang and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2509.18798},
  year   = {2025}
}

备注

5 pages,submitted to ICASSP2026