中文

基于弱标记音频片段的监督对比学习用于音乐版本匹配

声音 2025-05-19 v3 人工智能 机器学习 音频与语音处理 机器学习

摘要

检测音乐版本(同一作品的不同演绎)是一项具有挑战性的任务,具有重要的应用价值。由于真实标签的性质,现有方法在曲目级别(例如,整首歌曲)匹配音乐版本。然而,大多数应用要求在片段级别(例如,20秒的块)进行匹配。此外,现有方法采用分类损失和三元组损失,忽略了可能带来显著改进的更近期的损失函数。在本文中,我们提出了一种从弱标注片段中学习的方法,以及一种优于研究充分的替代方案的对比损失变体。前者基于成对片段距离缩减,而后者根据解耦、超参数和几何考量修改了现有的损失函数。凭借这两个要素,我们不仅在标准的曲目级别评估中取得了 SOTA 结果,还在片段级别评估中取得了突破性性能。我们相信,由于本文所解决挑战的通用性,所提出的方法可能在音频或音乐版本匹配之外的领域中得到应用。

关键词

引用

@article{arxiv.2502.16936,
  title  = {Supervised contrastive learning from weakly-labeled audio segments for musical version matching},
  author = {Joan Serrà and R. Oguz Araz and Dmitry Bogdanov and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2502.16936},
  year   = {2025}
}

备注

17 pages, 6 figures, 8 tables (includes Appendix); accepted at ICML25