面向查询示例同时学习鲁棒音频嵌入与均衡哈希码
音频与语音处理
2023-01-20 v2 机器学习
声音
摘要
音频指纹系统必须在大数据库中高效且鲁棒地识别查询片段。为此,最先进系统使用深度学习生成紧凑音频指纹。这些系统部署索引方法,以无监督方式将指纹量化为哈希码以加速搜索。然而,这些方法生成不均衡哈希码,导致其性能次优。因此,我们提出一种自监督学习框架,以端到端方式计算指纹与均衡哈希码,从而实现快速且准确的检索性能。我们将哈希码建模为均衡聚类过程,并将其视为最优传输问题的一个实例。实验结果表明,与对比方法相比,所提方法在保持高精度的同时提升了检索效率,尤其在高度失真条件下。此外,我们的系统在计算负载与内存存储上高效且可扩展。
引用
@article{arxiv.2211.11060,
title = {Simultaneously Learning Robust Audio Embeddings and balanced Hash codes for Query-by-Example},
author = {Anup Singh and Kris Demuynck and Vipul Arora},
journal= {arXiv preprint arXiv:2211.11060},
year = {2023}
}
备注
We need to rewrite the subsection 'Efficiency' section under section 4 to make it more easy to follow for the readers and appreciate our results