StyleSinger:面向域外歌唱语音合成的风格迁移
音频与语音处理
2025-06-02 v5 计算与语言
声音
摘要
域外 (OOD) 歌唱语音合成 (SVS) 的风格迁移侧重于生成具有源自参考歌唱语音样本的未见风格(如音色、情感、发音和咬字技巧)的高质量歌唱语音。然而,对歌唱语音风格的复杂细微差别进行建模是一项艰巨的任务,因为歌唱语音具有极高的表现力。此外,现有的 SVS 方法在 OOD 场景下合成歌唱语音的质量会下降,因为它们基于目标声音属性在训练阶段是可辨识的这一假设。为了克服这些挑战,我们提出了 StyleSinger,这是第一个用于域外参考歌唱语音样本零样本风格迁移的歌唱语音合成模型。StyleSinger 包含两种关键方法以增强有效性:1) 残差风格适配器 (RSA),它采用残差量化模块来捕捉歌唱语音中多样的风格特征;2) 不确定性建模层归一化 (UMLN),用于在训练阶段扰动内容表示中的风格属性,从而提高模型泛化能力。我们在零样本风格迁移中的广泛评估无可辩驳地证明,StyleSinger 在音频质量和与参考歌唱语音样本的相似度方面均优于基线模型。歌唱语音样本的访问可在 https://aaronz345.github.io/StyleSingerDemo/ 找到。
引用
@article{arxiv.2312.10741,
title = {StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis},
author = {Yu Zhang and Rongjie Huang and Ruiqi Li and JinZheng He and Yan Xia and Feiyang Chen and Xinyu Duan and Baoxing Huai and Zhou Zhao},
journal= {arXiv preprint arXiv:2312.10741},
year = {2025}
}
备注
Accepted by AAAI 2024