可变长度音频指纹
声音
2026-03-26 v1 人工智能
多媒体
摘要
音频指纹将音频转换为低维表示,允许受扭曲的录音通过相似的指纹被识别为原始音频。现有的深度学习方法刚性地指纹固定长度的音频片段,从而忽略分段期间的时序动态。为克服这一限制,我们提出了可变长度音频指纹(VLAFP),一种支持可变长度指纹的方法。据我们所知,VLAFP是首个能够处理训练和测试中可变长度音频的深度音频指纹模型。我们的实验表明,VLAFP在实时音频识别和音频检索中跨越三个真实世界数据集,优于现有最先进的方法。
引用
@article{arxiv.2603.23947,
title = {Variable-Length Audio Fingerprinting},
author = {Hongjie Chen and Hanyu Meng and Huimin Zeng and Ryan A. Rossi and Lie Lu and Josh Kimball},
journal= {arXiv preprint arXiv:2603.23947},
year = {2026}
}