中文

稀有数据下的音乐音频表示学习

声音 2025-05-12 v1 机器学习 音频与语音处理

摘要

大型深度学习模型用于音乐,包括专注于学习通用音乐音频表示的模型,通常被假设需要大量训练数据才能实现高性能。如果是这样的话,这将在音频数据或标注稀缺的场景(如边缘化音乐传统、非流行音乐类型以及个人化音乐创作和聆听)中提出挑战。理解这些模型在有限数据情景下的行为可能对于开发解决这些问题的技术至关重要。本文探讨了在有限数据学习情景下,几种音乐音频表示模型的行为。我们考虑各种架构、训练范式和输入持续时间的音乐模型,并在数据长度从 5 小时到 8000 小时不等的集合上进行训练。我们在各种音乐信息检索任务上评估所学表示,并分析其对噪声的鲁棒性。我们表明,在特定条件下,来自有限数据和甚至随机模型的表示与大数据集模型的表示表现相当,尽管在某些任务中,手工特征仍优于所有学习到的表示。

关键词

引用

@article{arxiv.2505.06042,
  title  = {Learning Music Audio Representations With Limited Data},
  author = {Christos Plachouras and Emmanouil Benetos and Johan Pauwels},
  journal= {arXiv preprint arXiv:2505.06042},
  year   = {2025}
}

备注

Presented at ICASSP 2025