面向混合模态图像检索的动态加权组合器
计算机视觉与模式识别
2023-12-12 v1
摘要
混合模态图像检索(MMIR)作为一种灵活的搜索范式引起了广泛关注。然而,由于严重忽略了两个关键因素,以往的方法始终只能取得有限的性能。1)图像和文本模态的贡献不同,却被错误地同等对待。2)在描述来自多样真实世界场景的网络数据集中用户意图的文本时,存在固有的标签噪声,从而导致过拟合。我们提出了一种动态加权组合器(DWC)来解决上述挑战,它具有三个优势。首先,考虑到模态之间的贡献差异,我们提出了一种可编辑模态去均衡器(EMD),包含两个模态特征编辑器和一个自适应加权组合器。其次,为了缓解标签噪声和数据偏差,我们提出了一种动态软相似度标签生成器(SSG),以隐式改善噪声监督。最后,为了弥合模态差距并促进相似度学习,我们提出了一个基于 CLIP 的相互增强模块,该模块通过混合模态对比损失交替训练。大量实验验证了我们所提出的模型在真实世界数据集上显著优于 SOTA 方法。源代码可在 \url{https://github.com/fuxianghuang1/DWC} 获取。
引用
@article{arxiv.2312.06179,
title = {Dynamic Weighted Combiner for Mixed-Modal Image Retrieval},
author = {Fuxiang Huang and Lei Zhang and Xiaowei Fu and Suqi Song},
journal= {arXiv preprint arXiv:2312.06179},
year = {2023}
}
备注
11 pages, 12 figures and 12 tables. To appear in AAAI 2024