中文

长尾音乐自动标记:基于few-shot的方法

音频与语音处理 2024-09-18 v2 信息检索 机器学习 声音

摘要

在数字音乐领域,使用标签高效地组织和检索大型数据库对音乐目录所有者至关重要。人工标记需要专家才能完成,但大多数情况下准确性较高;而通过监督学习的自动标记已接近令人满意的准确性,但仅限于预定义的训练标签集合。Few-shot 学习提供了可行的解决方案,通过仅少量人工提供的示例即可学习标签含义,从而实现自主标记。我们提出将 few-shot 学习方法整合到多标签音乐自动标记中,使用预训练模型的特征作为轻量级线性分类器(即线性探针)的输入。我们研究了不同流行的预训练特征以及不同数量的类别和每类样本的 various few-shot 参数化。我们的实验表明,一个简单模型使用预训练特征即可在显著减少训练数据(如每标签 20 个样本)的情况下,达到接近最先进模型的性能。此外,our linear probe 在使用整个训练数据集训练时,性能与领先模型相当。结果表明,这种基于迁移学习的 few-shot 方法能够有效解决仅限有限标记数据下自动分配长尾标签的问题。

关键词

引用

@article{arxiv.2409.07730,
  title  = {Music auto-tagging in the long tail: A few-shot approach},
  author = {T. Aleksandra Ma and Alexander Lerch},
  journal= {arXiv preprint arXiv:2409.07730},
  year   = {2024}
}

备注

Published in Audio Engineering Society NY Show 2024 as a Peer Reviewed (Category 1) paper; typos corrected