中文

使用音乐基础模型的鲁棒神经音频指纹

声音 2025-11-10 v1 人工智能

摘要

现代媒体平台如 TikTok 上失真、压缩和被操纵的音乐的广泛存在,动机了开发更稳健的音频指纹技术以识别音乐录音的来源。本文开发并评估了新的神经音频指纹技术,旨在提高其稳健性。我们对神经指纹方法做出了两项贡献:(1)我们使用预训练的音乐基础模型作为神经网络架构的 backbone;(2)我们扩展了数据增强的用途,以在包括时间拉伸、音调调制、压缩和滤波在内的广泛音频操纵下训练指纹模型。我们将我们的方法与两种最先进的神经指纹模型(NAFP 和 GraFPrint)进行系统比较。结果表明,使用音乐基础模型(例如 MuQ、MERT)提取的指纹在使用从零训练或在非音乐音频上预训练的模型提取的指纹方面 consistently 优于后者。分段级评估进一步揭示了其准确局部化指纹匹配的能力,这一能力对于目录管理具有重要的实际意义。

关键词

引用

@article{arxiv.2511.05399,
  title  = {Robust Neural Audio Fingerprinting using Music Foundation Models},
  author = {Shubhr Singh and Kiran Bhat and Xavier Riley and Benjamin Resnick and John Thickstun and Walter De Brouwer},
  journal= {arXiv preprint arXiv:2511.05399},
  year   = {2025}
}