中文

基于微分同胚流的多说话人情感转换变分框架

音频与语音处理 2022-11-10 v1 声音

摘要

本文提出一种用于语音中非平行情感转换的新框架。我们的框架基于两项关键贡献。首先,我们提出流行 CycleGAN 模型的随机版本。我们改进的损失函数引入 Kullback Leibler(KL)散度项,用以对齐生成器学习的源与目标数据分布,从而克服逐样本生成的局限。通过对该随机损失函数使用变分近似,我们证明此 KL 散度项可通过配对密度判别器实现。我们将此新架构称为变分 CycleGAN(VCGAN)。其次,我们将目标情感的韵律特征建模为源韵律特征的平滑可学习形变。该方法提供隐式正则化,在更好地对齐未见与分布外说话人范围方面具有关键优势。我们进行了严谨实验与对比研究,表明所提框架相较于若干 SOTA 基线具有较高性能且相当鲁棒。

关键词

引用

@article{arxiv.2211.05071,
  title  = {A Diffeomorphic Flow-based Variational Framework for Multi-speaker Emotion Conversion},
  author = {Ravi Shankar and Hsi-Wei Hsieh and Nicolas Charon and Archana Venkataraman},
  journal= {arXiv preprint arXiv:2211.05071},
  year   = {2022}
}

备注

Accepted in IEEE Transactions on Audio, Speech and Language Processing