利用半监督学习扩展音乐信息检索训练规模
音频与语音处理
2023-10-03 v1 声音
摘要
在数据驱动的音乐信息检索(MIR)时代,标注数据的稀缺一直是 MIR 任务成功的主要顾虑之一。在本工作中,我们利用半监督师生训练方法来改进 MIR 任务。在训练中,我们将无标注音乐数据规模扩展到 24 万小时,远大于任何公开 MIR 数据集。我们在带噪师生训练过程中迭代地创建并精炼伪标签。我们还探索了知识扩展,以迭代方式将模型规模从小于 3M 参数扩展到接近 100M 参数。我们在实验中研究了数据规模与模型规模之间的性能相关性。通过同时扩展模型规模与训练数据,我们的模型在多个 MIR 任务上相比以监督方式训练或基于自监督预训练模型的模型取得了最先进结果。据我们所知,这是首次尝试研究对多种 MIR 任务同时扩展模型与训练数据的效果。
引用
@article{arxiv.2310.01353,
title = {Scaling Up Music Information Retrieval Training with Semi-Supervised Learning},
author = {Yun-Ning Hung and Ju-Chiang Wang and Minz Won and Duc Le},
journal= {arXiv preprint arXiv:2310.01353},
year = {2023}
}