中文

通过合成潜在指纹生成实现音频识别的可扩展评估

声音 2025-09-24 v1 信息检索 音频与语音处理

摘要

由于大型公开音乐数据库的稀缺性,现实规模下的音频指纹评估受到限制。我们提出了一种无需音频的方法,通过合成潜在指纹来近似真实指纹的分布。该方法在预训练神经音频指纹系统提取的嵌入上训练 Rectified Flow 模型。使用我们系统生成的合成指纹可作为真实的干扰项,从而在无需额外音频的情况下实现大规模检索性能模拟。我们通过将分布与真实数据进行比较来评估合成指纹的保真度。我们进一步通过用合成干扰项增强真实参考数据库,在多个 state-of-the-art 音频指纹框架中对检索性能进行了基准测试,并表明使用合成干扰项获得的缩放趋势与使用真实干扰项获得的趋势高度一致。最后,我们将合成干扰项数据库扩展至超大规模以对检索性能进行建模,提供了一种不依赖于音频语料库访问权限的系统可扩展性实用指标。

关键词

引用

@article{arxiv.2509.18620,
  title  = {Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation},
  author = {Aditya Bhattacharjee and Marco Pasini and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2509.18620},
  year   = {2025}
}

备注

Under review for International Conference on Acoustics, Speech, and Signal Processing (ICASSP), Barcelona, 2026