中文

用于歌声转换的自监督表征

音频与语音处理 2023-03-23 v1

摘要

歌声转换模型将任意源歌手演唱的歌曲转换为目标歌手的声音。近来,利用 HuBERT 和 Wav2Vec 2.0 等自监督音频表征的方法进一步推进了当前最优水平。尽管这些方法生成了更自然且更具旋律性的歌唱输出,它们通常依赖混淆与解耦损失来使自监督表征对说话人与音高保持不变。本文规避了解耦训练,提出了一种新模型,该模型将 ASR 微调的自监督表征作为 HiFi-GAN 神经声码器的输入用于歌声转换。我们尝试了不同的 f0 编码方案,并表明使用并行转置卷积组(PBTC)的 f0 谐波生成模块结合 ASR 微调的 Wav2Vec 2.0 特征可得到最佳的歌声转换质量。此外,该模型能够使说话声变为歌唱声。我们还表明,推理时简单的 f0 偏移方案有助于保留歌手身份并提升我们歌声转换模型的性能。我们的结果得到了广泛的 MOS 研究的支持,这些研究比较了不同的消融实验与基线。

关键词

引用

@article{arxiv.2303.12197,
  title  = {Self-Supervised Representations for Singing Voice Conversion},
  author = {Tejas Jayashankar and Jilong Wu and Leda Sari and David Kant and Vimal Manohar and Qing He},
  journal= {arXiv preprint arXiv:2303.12197},
  year   = {2023}
}