USER:基于动量对比的统一语义增强用于图文检索
计算机视觉与模式识别
2023-01-18 v1
摘要
作为连接语言与视觉领域的一项基础且具挑战性的任务,图文检索(ITR)旨在从另一模态中搜索与给定查询语义相关的目标实例,其关键挑战在于跨不同模态度量语义相似性。尽管已取得显著进展,但现有方法通常存在两大局限:(1)直接利用基于自底向上注意力的区域级特征且平等对待每个区域,损害了表示的准确性。(2)采用基于小批量的端到端训练机制,限制了负样本对的规模。为解决这些局限,我们提出了一种用于ITR的统一语义增强动量对比学习(USER)方法。具体而言,我们精心设计了两个简单而有效的基于全局表示的语义增强(GSE)模块。其中一个通过自注意力算法学习全局表示,记为自引导增强(SGE)模块。另一个模块受益于预训练的CLIP模块,其提供了一种利用并迁移现成模型知识的新方案,记为CLIP引导增强(CGE)模块。此外,我们将MoCo的训练机制引入ITR,其中采用两个动态队列来丰富并扩大负样本对的规模。同时,开发了统一训练目标(UTO)以从基于小批量和基于动态队列的样本中进行学习。在基准数据集MSCOCO和Flickr30K上的大量实验证明了该方法在检索精度和推理效率上的优越性。源代码将发布于 https://github.com/zhangy0822/USER。
引用
@article{arxiv.2301.06844,
title = {USER: Unified Semantic Enhancement with Momentum Contrast for Image-Text Retrieval},
author = {Yan Zhang and Zhong Ji and Di Wang and Yanwei Pang and Xuelong Li},
journal= {arXiv preprint arXiv:2301.06844},
year = {2023}
}