中文

基于 wav2vec 2.0 迁移学习的自动歌词转写

音频与语音处理 2022-10-18 v2 声音 信号处理

摘要

近年来,由于大规模数据集的出现与自监督学习(SSL)范式的发展,自动语音识别(ASR)取得了显著进展。然而,作为其在歌唱领域的对应问题,自动歌词转写(ALT)的发展受限于数据匮乏与歌唱歌词可懂度下降。为弥合 ALT 与 ASR 之间的性能差距,我们尝试利用语音与歌唱之间的相似性。在本工作中,我们提出一种基于迁移学习的 ALT 方案,通过将对语音域设计的 SSL ASR 模型 wav2vec 2.0 适配至歌唱域来利用这些相似性。我们通过探究不同迁移起点的影响,最大化迁移学习的效果。我们进一步将原始 CTC 模型扩展为混合 CTC/注意力模型以提升性能。我们的方法在各种 ALT 基准数据集上大幅超越先前的方法。进一步实验表明,即便仅使用极小比例的训练数据,我们的方法仍具竞争力。

关键词

引用

@article{arxiv.2207.09747,
  title  = {Transfer Learning of wav2vec 2.0 for Automatic Lyric Transcription},
  author = {Longshen Ou and Xiangming Gu and Ye Wang},
  journal= {arXiv preprint arXiv:2207.09747},
  year   = {2022}
}

备注

Camera ready version of ISMIR 2022 submission