中文

EAD-VC:基于 IFUB 估计器与联合文本引导一致学习增强语音自动解耦用于语音转换

声音 2024-05-01 v1 音频与语音处理

摘要

使用无监督学习将语音解耦分为内容、韵律、音高和音色,以实现语音转换已成为热门研究主题。现有工作通常通过人工设计的瓶颈特征来实现语音成分解耦,无法实现充分的信息解耦,同时音高和韵律可能仍被混合在一起。在解耦过程中可能存在信息重叠的风险,导致语音自然性较差。为克服这些限制,我们提出了一个两阶段模型,以自监督方式解耦语音表示,而无需人工设计的瓶颈设计。该模型利用设计的上界估计器(IFUB)与互信息(MI)来分离语音成分之间的重叠信息。此外,我们设计了一个联合文本引导一致(TGC)模块,以引导提取语音内容并消除音色泄漏问题。实验表明,我们的模型在解耦有效性、语音自然性和相似度方面均优于基线方法。音频样本可在 https://largeaudiomodel.com/eadvc 找到。

关键词

引用

@article{arxiv.2404.19212,
  title  = {EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning},
  author = {Ziqi Liang and Jianzong Wang and Xulong Zhang and Yong Zhang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2404.19212},
  year   = {2024}
}

备注

Accepted by the 2024 International Joint Conference on Neural Networks (IJCNN 2024)