中文

歌唱声音转换中潜变量回归器损失的比较分析

声音 2023-02-28 v1 人工智能 音频与语音处理

摘要

先前研究表明,既有的说话声音转换(VC)技术在应用于歌唱声音转换(SVC)时表现不佳。我们提出在 otherwise 在 VC 任务中已成熟的损失函数中加入一个替代性损失分量,其已被证明可改善我们模型的 SVC 性能。我们首先在歌手录音的 mel 谱上训练了一个歌手身份嵌入(SIE)网络,利用对比学习产生歌手特定的方差编码。随后我们训练了一个以这些 SIE 为条件的知名自编码器框架(AutoVC),并测量使用不同潜变量回归器损失分量时 SVC 性能的差异。我们发现,相对于 SIE 使用该损失比相对于瓶颈嵌入表现更好,转换后的音频更自然且更针对目标歌手。该损失分量的引入具有显式迫使网络以音色相似性重构的优势,并且也消除了 AutoVC 瓶颈嵌入中解耦不良的影响。我们展示了在歌手转换音频片段上计算评估与人类评估之间的特殊差异,这凸显了两者的必要性。我们还提出了源歌手与目标歌手之间的音高匹配机制,以确保这些评估不受音高寄存器差异的影响。

关键词

引用

@article{arxiv.2302.13678,
  title  = {A Comparative Analysis Of Latent Regressor Losses For Singing Voice Conversion},
  author = {Brendan O'Connor and Simon Dixon},
  journal= {arXiv preprint arXiv:2302.13678},
  year   = {2023}
}

备注

Submitted to the Sound and Music Computing Conference 2023