中文

EMOCONV-DIFF: 基于扩散的非平行野外数据语音情感转换

音频与语音处理 2024-01-09 v2 声音 信号处理

摘要

语音情感转换的任务是将在发音话语中表达的情感转换为目标情感,同时保留词汇内容与说话人身份。尽管现有多数语音情感转换工作依赖演绎数据集与平行数据样本,本工作我们特别关注更具挑战性的野外场景且不依赖平行数据。为此,我们提出一种基于扩散的语音情感转换生成模型 EmoConv-Diff,其被训练为重建输入话语同时以该话语的情感为条件。随后在推理时,采用目标情感嵌入将输入话语的情感转换为给定目标情感。与在类别化表示上执行情感转换不同,我们使用连续唤醒维度表示情感,同时实现强度控制。我们在一个大型野外数据集 MSP-Podcast v1.10 上验证了所提方法。我们的结果表明,所提扩散模型确实能够合成具有可控目标情感的语音。关键的是,该方法在唤醒的极值处展现出改进性能,从而解决了语音情感转换文献中的常见挑战。

关键词

引用

@article{arxiv.2309.07828,
  title  = {EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data},
  author = {Navin Raj Prabhu and Bunlong Lay and Simon Welker and Nale Lehmann-Willenbrock and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2309.07828},
  year   = {2024}
}

备注

Accepted to ICASSP 2024