EmoReg:基于扩散模型的情感强度正则化方向性潜在向量建模
音频与语音处理
2024-12-31 v1 人工智能
多媒体
声音
摘要
情感语音转换(EVC)旨在将给定语音 utterance 的情感状态从离散的源情感转换为目标情感,同时保持语言内容。本文提出在扩散式 EVC 框架中对情感强度进行正则化,以生成目标情感的精确语音。传统方法通过情感类别概率或强度标签控制语音中情感状态的强度,往往导致风格操作不当且质量下降。相反,我们利用基于自监督学习的特征表示和情感嵌入空间中的无监督方向性潜在向量建模(DVM)来调节情感强度。这些情感嵌入可根据给定的目标情感强度和相应的方向向量进行修改。此外,更新后的嵌入可在逆扩散过程中与之融合,以生成所需情感和强度的语音。总而言之,本文旨在在扩散式 EVC 框架中实现情感强度的高质量正则化,这是首个此类工作。跨多个 SOTA 基线的主观和客观评估表明,所提方法在英语和印地语语言方面均表现优异。
引用
@article{arxiv.2412.20359,
title = {EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion},
author = {Ashishkumar Gudmalwar and Ishan D. Biyani and Nirmesh Shah and Pankaj Wasnik and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2412.20359},
year = {2024}
}
备注
Accepted to AAAI 2025