基于大语言模型的文本转语音的群组相对策略优化
音频与语音处理
2025-09-24 v1
摘要
本文提出了一种基于 GRPO 的方法,通过从现成的自动语音识别 (ASR) 模型中提取奖励,来增强基于大语言模型 (LLM) 的文本转语音 (TTS) 模型的性能。与以往用于基于 LLM 的 TTS 的强化学习方法相比,我们的方法不需要专门的模型来进行奖励计算或训练。此外,我们设计了一个复合奖励函数,将字符错误率 (CER) 与从 ASR 模型获得的负对数似然 (NLL) 相结合,提供了更具信息量和更准确的奖励信号。我们将 GRPO 微调应用于预训练的基于 LLM 的 TTS 模型,并评估了它们的零样本 TTS 性能。实验结果表明,所提出的方法显著提高了合成语音的可懂度和自然度。消融研究和进一步的分析证实了整合这两个奖励组件的有效性。
引用
@article{arxiv.2509.18798,
title = {Group Relative Policy Optimization for Text-to-Speech with Large Language Models},
author = {Chang Liu and Ya-Jun Hu and Ying-Ying Gao and Shi-Lei Zhang and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2509.18798},
year = {2025}
}
备注
5 pages,submitted to ICASSP2026