利用自监督图神经网络精炼音乐样本识别
声音
2025-06-23 v2 人工智能
信息检索
摘要
自动样本识别(ASID),即检测和识别音频录音中被重新使用的片段,以音频查询为基础的检索任务,正在音乐领域发挥着重要但具有挑战性的作用。虽然相关任务音频指纹在“真实世界”(噪声、回声)条件下实现了显著进展,但 ASID 系统在识别经历音乐修改的样本方面仍感到困难。因此,一个对常见音乐制作变换(如时间拉伸、音调移动、效果处理以及叠加或覆盖音乐)具有鲁健性的系统是一个重要的开放性挑战。本文提出一种轻量且可扩展的编码架构,采用对比学习框架中的图神经网络。我们的模型仅使用当前最先进系统的 9% 可训练参数,即可实现相当的性能,达到平均精度(mAP)44.2%。为了提升检索质量,我们引入了两阶段方法:首先进行粗糙相似性搜索以选择候选,然后通过跨注意力分类器以拒绝无关匹配并细化检索候选的排序——这是先前模型中缺乏的关键能力。此外,由于现实世界中的查询往往在持续时间上较短,我们针对短查询对系统进行基准测试,使用我们作为本工作一部分发布的 Sample100 数据集的新细粒度注释。
引用
@article{arxiv.2506.14684,
title = {Refining music sample identification with a self-supervised graph neural network},
author = {Aditya Bhattacharjee and Ivan Meresman Higgs and Mark Sandler and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2506.14684},
year = {2025}
}
备注
Accepted at International Conference for Music Information Retrieval (ISMIR) 2025