中文

可变长度音频指纹

声音 2026-03-26 v1 人工智能 多媒体

摘要

音频指纹将音频转换为低维表示,允许受扭曲的录音通过相似的指纹被识别为原始音频。现有的深度学习方法刚性地指纹固定长度的音频片段,从而忽略分段期间的时序动态。为克服这一限制,我们提出了可变长度音频指纹(VLAFP),一种支持可变长度指纹的方法。据我们所知,VLAFP是首个能够处理训练和测试中可变长度音频的深度音频指纹模型。我们的实验表明,VLAFP在实时音频识别和音频检索中跨越三个真实世界数据集,优于现有最先进的方法。

关键词

引用

@article{arxiv.2603.23947,
  title  = {Variable-Length Audio Fingerprinting},
  author = {Hongjie Chen and Hanyu Meng and Huimin Zeng and Ryan A. Rossi and Lie Lu and Josh Kimball},
  journal= {arXiv preprint arXiv:2603.23947},
  year   = {2026}
}