SongTrans:一种统一的歌词与音符转录及对齐方法
声音
2024-10-11 v2 音频与语音处理
摘要
已处理数据的数量对于推动歌声合成领域的发展至关重要。虽然现有工具可用于歌词或音符转录任务,但它们都需要相对耗时的预处理数据(例如,人声与伴奏分离)。此外,这些工具大多旨在解决单一任务,难以对齐歌词与音符(即识别歌词中每个单词对应的音符)。为了应对这些挑战,我们首先通过优化现有工具并标注大量歌曲的歌词-音符对来设计一个流水线。然后,基于标注数据,我们训练了一个统一的 SongTrans 模型,该模型能够直接转录歌词和音符并同时进行对齐,无需对歌曲进行预处理。我们的 SongTrans 模型由两个模块组成:(1) \textbf{自回归模块} 预测歌词,以及歌词中每个单词对应的时长和音符编号。(2) \textbf{非自回归模块} 预测音符的音高和时长。我们的实验表明,SongTrans 在歌词和音符转录任务中均取得了最先进(SOTA)的结果。此外,它是第一个能够将歌词与音符对齐的模型。实验结果表明,SongTrans 模型能够有效适应不同类型的歌曲(例如,带伴奏的歌曲),展示了其在实际应用中的通用性。
引用
@article{arxiv.2409.14619,
title = {SongTrans: An unified song transcription and alignment method for lyrics and notes},
author = {Siwei Wu and Jinzheng He and Ruibin Yuan and Haojie Wei and Xipin Wei and Chenghua Lin and Jin Xu and Junyang Lin},
journal= {arXiv preprint arXiv:2409.14619},
year = {2024}
}