基于自监督学习的端到端歌词识别
音频与语音处理
2022-10-28 v4 声音
摘要
歌词识别是音乐处理中的一项重要任务。尽管混合 HMM-TDNN 模型等传统算法取得了良好性能,但关于应用端到端模型与自监督学习(SSL)的研究仍很有限。本文首先建立歌词识别的端到端基线,随后探索 SSL 模型在歌词识别任务上的性能。我们评估了多种具有不同训练方法(掩码重建、掩码预测、自回归重建与对比学习)的上游 SSL 模型。我们的端到端自监督模型在 DAMP 音乐数据集上评估,即使未使用大语料训练的语言模型,在开发集上超越先前最先进(SOTA)系统 5.23%,在测试集上超越 2.4%。此外,我们考察了背景音乐对自监督学习模型性能的影响,并得出结论:在存在背景音乐的情况下,SSL 模型无法高效提取特征。最后,考虑到这些模型并未在音乐数据集上训练,我们研究了 SSL 特征的域外泛化能力。
引用
@article{arxiv.2209.12702,
title = {End-to-End Lyrics Recognition with Self-supervised Learning},
author = {Xiangyu Zhang and Shuyue Stella Li and Zhanhong He and Roberto Togneri and Leibny Paola Garcia},
journal= {arXiv preprint arXiv:2209.12702},
year = {2022}
}
备注
4 pages, 2 figures, 3 tables