中文

利用多样化基于语义的音频预训练模型进行歌声转换

声音 2024-09-17 v3 音频与语音处理

摘要

歌声转换(SVC)是一项使任何歌手能够演唱任何歌曲的技术。为此,必须从源音频中获取与说话人无关的表征,这是一个重大挑战。一种常见的解决方案是利用基于语义的音频预训练模型作为特征提取器。然而,所提取特征在多大程度上能满足 SVC 需求仍是一个开放问题。这包括其准确建模旋律与歌词的能力、其底层声学信息的说话人无关性,以及其在真实声学环境中的鲁棒性。在本研究中,我们详细考察了经典基于语义的预训练模型中的知识。我们发现不同模型的知识具有多样性,且可互补用于 SVC。基于上述发现,我们设计了一个基于多样化基于语义的特征融合的歌声转换框架(DSFF-SVC)。实验结果表明,DSFF-SVC 具有泛化能力,并能改进多种现有 SVC 模型,尤其在具有挑战性的真实世界转换任务中。我们的演示网站位于 https://diversesemanticsvc.github.io/。

关键词

引用

@article{arxiv.2310.11160,
  title  = {Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion},
  author = {Xueyao Zhang and Zihao Fang and Yicheng Gu and Haopeng Chen and Lexiao Zou and Junan Zhang and Liumeng Xue and Zhizheng Wu},
  journal= {arXiv preprint arXiv:2310.11160},
  year   = {2024}
}

备注

Accepted by IEEE SLT 2024