基于先验与后验不确定性的鲁棒歌声合成训练
声音
2025-12-17 v1
摘要
歌声合成(SVS)在近年来取得了显著进展。然而,与语音和通用音频数据相比,公开可用的歌唱数据集仍然有限。在实践中,这种数据稀缺往往导致长尾场景中的性能下降,例如不平衡的音高分布或罕见的歌唱风格。为了缓解这些挑战,我们提出了基于不确定性的优化方法来改进端到端 SVS 模型的训练过程。首先,我们在对抗训练中引入可微分的数据增强,以样本为单位操作以增加先验不确定性。其次,我们引入了一个帧级不确定性预测模块,用于估计后验不确定性,使模型能够将更多的学习能力分配给低置信度片段。在 Opencpop 和 Ofuton-P 数据集上,针对中文和日文的实证结果表明,我们的方法从多个方面提升了性能。
引用
@article{arxiv.2512.14653,
title = {Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty},
author = {Yiwen Zhao and Jiatong Shi and Yuxun Tang and William Chen and Shinji Watanabe},
journal= {arXiv preprint arXiv:2512.14653},
year = {2025}
}
备注
Accepted by ASRU 2025