中文

PAVITS:探索面向端到端情感语音转换的韵律感知 VITS

音频与语音处理 2024-03-27 v1 声音 信号处理

摘要

本文提出了用于情感语音转换(EVC)的韵律感知 VITS(PAVITS),旨在实现 EVC 的两个主要目标:高内容自然度与高情感自然度,这对于满足人类感知需求至关重要。为提升转换音频的内容自然度,受 VITS 高音频质量的启发,我们开发了一种端到端 EVC 架构。通过无缝集成声学转换器和声码器,我们有效解决了现有 EVC 模型中普遍存在的情感韵律训练与运行时转换之间的不匹配问题。为进一步增强情感自然度,我们引入了情感描述符来建模不同语音情感的细微韵律变化。此外,我们提出了一个韵律预测器,根据提供的情感标签从文本预测韵律特征。值得注意的是,我们引入了韵律对齐损失以建立两种不同模态间潜在韵律特征的联系,确保训练的有效性。实验结果表明,PAVITS 的性能优于 state-of-the-art EVC 方法。语音样本可在 https://jeremychee4.github.io/pavits4EVC/ 获取。

关键词

引用

@article{arxiv.2403.01494,
  title  = {PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion},
  author = {Tianhua Qi and Wenming Zheng and Cheng Lu and Yuan Zong and Hailun Lian},
  journal= {arXiv preprint arXiv:2403.01494},
  year   = {2024}
}

备注

Accepted to ICASSP2024