中文

鲁棒的一次性歌声转换

声音 2023-10-09 v2 机器学习 音频与语音处理

摘要

深度生成模型的最新进展提升了语音领域声音转换的质量。然而,由于音高、响度和发音方面音乐表达的多样性更广,未见歌手的高质量歌声转换(SVC)仍具挑战性。此外,歌声常带有混响和伴奏音乐录制,这使 SVC 更具挑战。在本工作中,我们提出一种鲁棒的一次性 SVC(ROSVC),即便在此类失真歌声上也能鲁棒地执行任意到任意的 SVC。为此,我们首先提出一种基于生成对抗网络的一次性 SVC 模型,该模型通过部分域条件和音高分布匹配与 AdaIN-skip 条件泛化到未见歌手,并学习准确恢复目标音高。然后我们提出一种称为 Robustify 的两阶段训练方法:第一阶段在干净数据上训练一次性 SVC 模型以确保高质量转换,第二阶段向模型编码器引入增强模块以提升从失真歌声中的特征提取能力。为进一步提升声音质量与音高重建精度,我们最终提出一种用于歌声神经声码器的分层扩散模型。实验结果表明,所提方法在见与未见歌手上均优于最先进的一次性 SVC 基线,并显著提升了针对失真的鲁棒性。

关键词

引用

@article{arxiv.2210.11096,
  title  = {Robust One-Shot Singing Voice Conversion},
  author = {Naoya Takahashi and Mayank Kumar Singh and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2210.11096},
  year   = {2023}
}