基于DNN的文本转语音中情感表达外推的模型架构
音频与语音处理
2021-02-23 v1
摘要
本文提出了一些架构,以促进基于深度神经网络(DNN)的文本转语音(TTS)中情感表达的外推。在本研究中,“外推情感表达”的含义是借用他人的情感表达,且无需收集目标说话人发出的情感语音。尽管DNN具有构建带情感表达的基于DNN的TTS的潜在能力,且一些基于DNN的TTS系统已在人类语音多样性表达方面展现出令人满意的性能,但收集目标说话人发出的情感语音是必要且麻烦的。为解决此问题,我们提出了将说话人特征与情感特征分离训练、并以任意说话人与情感组合质量合成语音的架构。这些架构包括并行模型(PM)、串行模型(SM)、辅助输入模型(AIM)以及混合模型(PM&AIM和SM&AIM)。这些模型通过少数说话人发出的情感语音和多数说话人发出的中性语音进行训练。客观评估表明,开放情感测试中的性能提供的信息不足。其与封闭情感测试中的结果进行了比较,但每位说话人都有自己表达情感的方式。然而,主观评估结果表明,所提模型能在一定程度上传达情感信息。值得注意的是,PM能以>60%的准确率正确传达悲伤和喜悦情感。
引用
@article{arxiv.2102.10345,
title = {Model architectures to extrapolate emotional expressions in DNN-based text-to-speech},
author = {Katsuki Inoue and Sunao Hara and Masanobu Abe and Nobukatsu Hojo and Yusuke Ijima},
journal= {arXiv preprint arXiv:2102.10345},
year = {2021}
}
备注
This is the author's final draft. Accepted by Speech Communication. Please refer to the journal if you want