中文

FreeSVC:迈向零样本多语种歌唱语音转换

声音 2025-03-18 v1 音频与语音处理

摘要

本工作提出了 FreeSVC,一种极具前景的多语种歌唱语音转换方法。该方法利用增强的 VITS 模型结合说话人不变聚类(SPIN)以获得更好的内容表示,并采用了最先进的(SOTA)说话人编码器 ECAPA2。FreeSVC 引入了可训练的语言嵌入以处理多种语言,并采用先进的说话人编码器将说话人特征从语言内容中解耦。FreeSVC 专为零样本学习设计,无需大量特定语言的训练即可实现跨语言歌唱语音转换。我们证明,多语种内容提取器对于最优的跨语言转换至关重要。我们的源代码和模型已公开发布。

关键词

引用

@article{arxiv.2501.05586,
  title  = {FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion},
  author = {Alef Iury Siqueira Ferreira and Lucas Rafael Gris and Augusto Seben da Rosa and Frederico Santos de Oliveira and Edresson Casanova and Rafael Teixeira Sousa and Arnaldo Candido Junior and Anderson da Silva Soares and Arlindo Galvão Filho},
  journal= {arXiv preprint arXiv:2501.05586},
  year   = {2025}
}