MakeSinger: 一种基于无分类器扩散引导的数据高效歌声合成的半监督训练方法
音频与语音处理
2024-06-11 v1 人工智能
摘要
在本文中,我们提出了MakeSinger,一种通过无分类器扩散引导进行歌声合成(SVS)的半监督训练方法。SVS的挑战在于收集文本、音高和音频数据的对齐集成本高昂。MakeSinger使得基于扩散的SVS模型能够从任何语音和歌声数据中训练,无论其标注情况如何,从而利用大量未标注数据提高生成语音的质量。在推理时,我们新颖的双重引导机制通过估计掩码输入的分数,在反向扩散步骤中提供文本和音高引导。实验结果表明,以半监督方式训练的模型在发音、音高准确性和整体质量方面优于仅使用标注数据训练的其他基线模型。此外,我们证明通过在训练中添加文本到语音(TTS)数据,该模型可以合成TTS说话人的歌声,即使没有他们的歌声数据。
引用
@article{arxiv.2406.05965,
title = {MakeSinger: A Semi-Supervised Training Method for Data-Efficient Singing Voice Synthesis via Classifier-free Diffusion Guidance},
author = {Semin Kim and Myeonghun Jeong and Hyeonseung Lee and Minchan Kim and Byoung Jin Choi and Nam Soo Kim},
journal= {arXiv preprint arXiv:2406.05965},
year = {2024}
}
备注
Accepted to Interspeech 2024