中文

基于注意力的音频嵌入用于示例查询

音频与语音处理 2024-11-22 v2 声音

摘要

理想的音频检索系统能从庞大数据库中高效且鲁棒地识别短查询片段。然而,知名音频指纹系统在强信号失真水平下性能不足。本文提出一种音频检索系统,利用对比学习框架生成抗噪声与混响的音频指纹。利用这些指纹,该方法执行全面搜索以识别查询音频并精确估计其在参考音频中的时间戳。我们的框架训练一个 CNN 以最大化从干净音频及其对应失真与时移版本提取的嵌入对之间的相似度。我们采用通道式谱-时注意力机制,通过赋予信号中显著谱-时块更大权重来更好区分音频。实验结果表明,我们的系统在计算与内存使用上高效,且在更高失真水平下比竞争的最先进(state-of-the-art)系统更准确,并可扩展至更大数据库。

关键词

引用

@article{arxiv.2210.08624,
  title  = {Attention-Based Audio Embeddings for Query-by-Example},
  author = {Anup Singh and Kris Demuynck and Vipul Arora},
  journal= {arXiv preprint arXiv:2210.08624},
  year   = {2024}
}

备注

Accepted in ISMIR 2022