通过真实评估协议的对比学习与迁移学习在有效音频指纹识别中的应用
声音
2025-09-16 v1 人工智能
信息检索
机器学习
音频与语音处理
摘要
近期的歌曲识别进展利用深度神经网络从原始波形直接学习紧凑音频指纹。虽然这些方法在受控环境下表现良好,但在实际场景中 accuracy 会显著下降,尤其是通过移动设备在噪声环境中捕获的音频。本文引入一种新颖的评估协议,旨在更贴近实际条件。我们生成三段相同的音频录音,每个录音的噪声水平递增,并使用移动设备的麦克风捕获。我们的结果显示,在该评估协议下,两种基于 CNN 的最新模型性能大幅下降,与此前报告的基准测试结果形成鲜明对比。此外,我们强调在对比损失训练期间数据增强管道的关键作用。通过引入低通和高通滤波器,我们显著提升了两种系统在本文提出的评估中的性能。进一步,我们开发了一个基于 Transformer 的模型,配合量身定制的投影模块,证明从语义相关领域迁移知识可提供更稳健的解决方案。Transformer 架构在所有噪声水平和查询持续时间方面均超越 CNN 模型。在低噪声条件下,我们实现 1 秒查询找到正确歌曲的检索率为 47.99%,10 秒查询为 97%,分别超过第二名最佳模型 14% 和 18.5%。在重噪声条件下,我们实现 15 秒查询持续时间的检测率为 56.5%。所有实验均在包含 10 万首歌曲的公开大型数据集上进行,查询结果匹配 Against 5600 万向量的数据库。
关键词
引用
@article{arxiv.2507.06070,
title = {Contrastive and Transfer Learning for Effective Audio Fingerprinting through a Real-World Evaluation Protocol},
author = {Christos Nikou and Theodoros Giannakopoulos},
journal= {arXiv preprint arXiv:2507.06070},
year = {2025}
}
备注
International Journal of Music Science, Technology and Art, 15 pages, 7 figures