VISinger2+:通过自监督学习表示增强的端到端歌声合成
声音
2024-12-17 v2 音频与语音处理
摘要
随着深度学习技术的出现,歌声合成(SVS)取得了显著进展。然而,SVS中的一个重大挑战是标记歌声数据的稀缺性,这限制了监督学习方法的有效性。为了应对这一挑战,本文介绍了一种新颖的方法,通过利用来自预训练自监督学习模型的未标记数据来增强SVS的质量。在现有VISinger2框架的基础上,本研究将额外的频谱特征信息集成到系统中以增强其性能。这种集成旨在利用来自预训练模型的丰富声学特征,从而丰富合成过程,产生更自然、更具表现力的歌声。在各种语料库上的实验结果表明,这种方法在客观和主观指标上都能有效提高合成歌声的整体质量。
引用
@article{arxiv.2406.08761,
title = {VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation},
author = {Yifeng Yu and Jiatong Shi and Yuning Wu and Yuxun Tang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2406.08761},
year = {2024}
}
备注
8 pages, 2 figures, SLT 2024