EmoCat:与语言无关的情感语音转换
音频与语音处理
2021-01-15 v1 声音
摘要
情感语音转换模型在不改变说话人身份或语言内容的情况下调整语音中的情感。它们比文本到语音模型更少依赖数据,并允许为下游任务生成大量情感数据。在本工作中我们提出 EmoCat,一种与语言无关的情感语音转换模型。它通过利用大量美式英语情感数据,以少于 45 分钟德语情感录音在德语中实现高质量情感转换。EmoCat 是基于 CopyCat(一种迁移韵律的语音转换系统)的编码器-解码器模型。我们使用对抗训练从编码器到解码器移除情感泄漏。该对抗训练通过对梯度反转的新贡献得以改进,以真正反转梯度。这允许仅移除泄漏信息并收敛到具有更高转换性能的更优极值。评估表明 Emocat 可以转换到不同情感,但相比录音在情感强度上有所欠缺,特别是对于极具表现力的情感。EmoCat 能够在测试的六种情感强度中有五种达到与录音相当的音频质量。
引用
@article{arxiv.2101.05695,
title = {EmoCat: Language-agnostic Emotional Voice Conversion},
author = {Bastian Schnell and Goeric Huybrechts and Bartek Perz and Thomas Drugman and Jaime Lorenzo-Trueba},
journal= {arXiv preprint arXiv:2101.05695},
year = {2021}
}
备注
Submitted to IEEE ICASSP 2021