用于提升情感可判别性的情感文本到语音合成的强化学习
计算与语言
2021-06-15 v2
摘要
情感文本到语音合成(ETTS)近年来取得诸多进展。然而,生成语音常无法由其预期情感类别在感知上被辨识。为解决该问题,我们提出一种用于ETTS的新型交互式训练范式,记为i-ETTS,其旨在通过语音情感识别(SER)模型的交互直接提升情感可判别性。此外,我们制定了一种基于强化学习的迭代训练策略以确保i-ETTS优化的质量。实验结果表明,所提i-ETTS通过渲染具有更准确情感风格的语音优于最先进的基线。据我们所知,这是首个在情感文本到语音合成中研究强化学习的工作。
引用
@article{arxiv.2104.01408,
title = {Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability},
author = {Rui Liu and Berrak Sisman and Haizhou Li},
journal= {arXiv preprint arXiv:2104.01408},
year = {2021}
}
备注
5 pages, 4 figures, in Proceedings of INTERSPEECH 2021 conference, Speech Samples: https://ttslr.github.io/i-ETTS