EMORL-TTS:基于强化学习的大语言模型语音合成细粒度情感控制
声音
2026-01-27 v2
摘要
近期基于大语言模型的语音合成系统实现了优异的音质和零样本能力,但由于依赖离散语音令牌,缺乏细粒度的情感控制。现有方法要么将情感限制在分类标签上,要么无法泛化到大语言模型架构。我们提出 EMORL-TTS(基于强化学习的细粒度情感可控语音合成),一个将 VAD 空间中的全局强度控制与局部重音调节相统一的框架。我们的方法结合监督微调与由情感类别、强度和重音等任务特定奖励引导的强化学习。此外,我们进一步研究了重音位置如何调节细粒度情感强度。实验表明,EMORL-TTS 在保持与强基线大语言模型语音合成系统相当合成质量的同时,提升了情感准确性、强度区分度和重音清晰度。
引用
@article{arxiv.2510.05758,
title = {EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS},
author = {Haoxun Li and Yu Liu and Yuqing Sun and Hanlei Shi and Leyuan Qu and Taihao Li},
journal= {arXiv preprint arXiv:2510.05758},
year = {2026}
}
备注
Accepted by ICASSP 2026