利用解耦自监督表示与基于神经声码器的重合成进行自然场景语音情感转换
音频与语音处理
2023-06-06 v1 人机交互
机器学习
摘要
语音情感转换旨在将口语 utterance 的表达情感转换为目标情感,同时保留词汇信息与说话人身份。本工作中,我们特别关注无并行数据的自然场景情感转换,并出现词汇、说话人与情感信息解耦的问题。本文引入一种方法,使用自监督网络解耦 utterance 的词汇、说话人与情感内容,随后使用 HiFiGAN 声码器将解耦表示重合成为目标情感的语音信号。为更好地表示并实现情感强度控制,我们特别关注连续表示的唤醒维度,而非在类别表示上执行情感转换。我们在大型自然场景 MSP-Podcast 数据集上测试了我们的方法。结果表明,所提方法能恰当地以输入语音的情感内容为条件,并能够为目标情感合成自然听感的语音。结果进一步揭示,该方法对中等唤醒度(2至6)的语音合成优于极端唤醒度(1和7)。
引用
@article{arxiv.2306.01916,
title = {In-the-wild Speech Emotion Conversion Using Disentangled Self-Supervised Representations and Neural Vocoder-based Resynthesis},
author = {Navin Raj Prabhu and Nale Lehmann-Willenbrock and Timo Gerkmann},
journal= {arXiv preprint arXiv:2306.01916},
year = {2023}
}
备注
Submitted to 15th ITG Conference on Speech Communication