中文

MR-SVS:基于多参考编码器的歌唱语音合成

音频与语音处理 2022-01-12 v1 声音

摘要

多说话人歌唱语音合成旨在生成由不同说话人演唱的歌唱语音。为泛化至新说话人,先前的零样本歌唱自适应方法通过单条参考音频的固定大小嵌入获取目标说话人的音色。然而,它们面临若干挑战:1)固定大小说话人嵌入不足以捕捉目标音色的全部细节;2)单条参考音频未包含目标说话人充足的音色信息;3)不同说话人之间的音高不一致亦导致生成语音质量下降。本文提出一种称为 MR-SVS 的新模型以应对这些问题。具体而言,我们采用多参考编码器与固定大小编码器,从多条参考音频中编码目标说话人的音色。多参考编码器能捕捉目标音色更多的细节与变化。此外,我们提出一种精心设计的移调方法来解决音高不一致问题。实验表明,我们的方法在自然度与相似度上均优于基线方法。

关键词

引用

@article{arxiv.2201.03864,
  title  = {MR-SVS: Singing Voice Synthesis with Multi-Reference Encoder},
  author = {Shoutong Wang and Jinglin Liu and Yi Ren and Zhen Wang and Changliang Xu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2201.03864},
  year   = {2022}
}