中文

MAIN-VC:用于 One-shot 语音转换的轻量级语音表征解耦

声音 2024-11-26 v2 音频与语音处理

摘要

One-shot 语音转换旨在仅用一条语音样本,将任意源语音的音色转换为匹配未见目标说话人的音色。现有方法在令人满意的语音表征解耦方面面临困难,并且由于其中一些方法利用大量复杂模块进行解耦,导致网络规模庞大。在本文中,我们提出名为 MAIN-VC 的模型,通过简洁的神经网络进行有效解耦。所提模型利用 Siamese 编码器学习干净的表征,并通过所设计的互信息估计器进一步增强。Siamese 结构与新设计的卷积模块有助于我们模型的轻量化,同时确保在多样化语音转换任务中的性能。实验结果表明,在 one-shot 语音转换场景下,与现有方法相比,所提模型获得了可比的主观分数,并在客观指标上展现出改进。

关键词

引用

@article{arxiv.2405.00930,
  title  = {MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion},
  author = {Pengcheng Li and Jianzong Wang and Xulong Zhang and Yong Zhang and Jing Xiao and Ning Cheng},
  journal= {arXiv preprint arXiv:2405.00930},
  year   = {2024}
}

备注

Accepted by the 2024 International Joint Conference on Neural Networks (IJCNN 2024)