基于锚点的深度度量学习用于音频-视觉检索
声音
2024-04-24 v1 人工智能
信息检索
多媒体
音频与语音处理
摘要
度量学习最小化相似(正)数据对之间的差距,同时增加异构(负)数据对之间的间隔,以捕捉数据结构并提升诸如音频-视觉跨模态检索(AV-CMR)等任务的性能。最近的研究采用采样方法从嵌入空间中选择有影响的数据点。然而,由于训练数据的稀缺,模型训练未能充分探索空间,导致对整体正负分布的表征不完整。本文提出一种创新的基于锚点的深度度量学习(AADML)方法,以解决这一挑战,通过揭示现有数据点之间的潜在关联性,增强共享嵌入空间的质量。具体而言,我们的方法通过将每个样本视为锚点及其语义相似样本之间的依赖关系,建立基于相关性图的流形结构。通过注意力驱动的机制对该潜在流形结构中的相关性进行动态加权,获得每个锚点的锚点感知(AA)得分。这些 AA 得分作为数据代理,用于计算度量学习方法中的相对距离。在两个音频-视觉基准数据集上进行的大量实验表明,我们提出的 AADML 方法效果显著,显著超越了最先进的模型。此外,我们进一步研究了将 AA 代理与各种度量学习方法集成,进一步凸显了我们方法的有效性。
引用
@article{arxiv.2404.13789,
title = {Anchor-aware Deep Metric Learning for Audio-visual Retrieval},
author = {Donghuo Zeng and Yanan Wang and Kazushi Ikeda and Yi Yu},
journal= {arXiv preprint arXiv:2404.13789},
year = {2024}
}
备注
9 pages, 5 figures. Accepted by ACM ICMR 2024