EmoSpeech:引导FastSpeech2实现情感语音合成
音频与语音处理
2023-07-04 v1 机器学习
声音
摘要
最先进的语音合成模型试图尽可能接近人声。因此,情感建模是文本到语音(TTS)研究的重要组成部分。在我们的工作中,我们选取FastSpeech2作为起点,并提出了一系列用于合成情感语音的改进。根据自动与人工评估,我们的模型EmoSpeech在生成语音的MOS分数和情感识别准确率方面均超越了现有模型。我们针对构成EmoSpeech的每一个FastSpeech2架构扩展提供了详细的消融研究。文本中情感分布的不均匀性对于更好的合成语音和语调感知至关重要。我们的模型包含一种调节机制,通过允许情感以不同强度水平作用于每个音素,有效处理了该问题。人工评估表明,所提出的改进生成了具有更高MOS和情感表现力的音频。
引用
@article{arxiv.2307.00024,
title = {EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech},
author = {Daria Diatlova and Vitaly Shutov},
journal= {arXiv preprint arXiv:2307.00024},
year = {2023}
}