中文

基于音频填充的演唱风格转换框架——Serenade

声音 2025-07-08 v2 音频与语音处理

摘要

我们提出Serenade,一种用于演唱风格转换(SSC)任务的新框架。尽管歌手身份转换在过去的几年中取得了显著进展,但演唱风格的转换仍是一个未被充分探索的研究领域。我们发现SSC存在三个主要挑战:建模目标风格、解耦源风格以及保留源旋律。为了建模目标演唱风格,我们采用音频填充任务,通过预测被掩码目标梅尔频谱图的掩码片段,利用被掩码目标梅尔频谱图的补充部分以及解耦的声学特征,使用流匹配模型。另一方面,为了解耦源演唱风格,我们采用循环训练方法,使用合成转换样本作为源输入,重建原始源梅尔频谱图作为目标。最后,为了更好地保留源旋律,我们研究了使用基于源滤波的声码器进行后处理模块,并使用原始F0模式重新合成转换后的波形。我们的实验结果表明,Serenade框架能够处理通用的SSC任务,尤其在建模气声和混合演唱风格方面表现最佳。我们还发现,使用原始F0模式重新合成可减轻不准音的现象并提高自然度,但由于未将F0模式转换为目标风格,在相似度方面存在轻微的权衡。

关键词

引用

@article{arxiv.2503.12388,
  title  = {Serenade: A Singing Style Conversion Framework Based On Audio Infilling},
  author = {Lester Phillip Violeta and Wen-Chin Huang and Tomoki Toda},
  journal= {arXiv preprint arXiv:2503.12388},
  year   = {2025}
}

备注

Accepted to EUSIPCO 2025