中文

用于音频指纹识别与检索的预训练Conformers

声音 2025-09-12 v2 人工智能 信息检索 音频与语音处理

摘要

Conformers因其捕捉局部和全局交互的能力在语音处理中取得了很好的结果。在本工作中,我们利用自监督对比学习框架训练基于Conformer的编码器,这些编码器能够为小的音频片段生成独特的嵌入,并很好地泛化到先前未见过的数据。我们在使用仅3秒音频生成嵌入的情况下取得了音频检索任务的最先进结果。我们的模型几乎完全不受时间错位的影响,并在其他音频失真(如噪声、混响或极端时间拉伸)的情况下取得了最先进的结果。代码和模型公开发布,并且由于我们使用流行的、免费可用的不同规模数据集进行训练和测试,结果易于复现。

关键词

引用

@article{arxiv.2508.11609,
  title  = {Pretrained Conformers for Audio Fingerprinting and Retrieval},
  author = {Kemal Altwlkany and Elmedin Selmanovic and Sead Delalic},
  journal= {arXiv preprint arXiv:2508.11609},
  year   = {2025}
}