中文

基于多模态梯度注意力的可解释组合图像检索学习

计算机视觉与模式识别 2023-09-01 v1

摘要

我们考虑组合图像检索问题,该问题接受一个由图像和修改文本组成的输入查询,修改文本指示要对图像所做的期望更改,并检索与这些更改匹配的图像。当前解决该问题的最先进(SOTA)技术使用全局特征进行检索,由于特征的全局性质,导致对感兴趣修改区域的定位不正确,在真实世界、自然场景图像的情况下更为明显。由于修改文本通常对应于图像中的特定局部更改,模型学习局部特征以能够更好地定位和检索至关重要。为此,我们的关键创新是一种新的基于梯度注意力的学习目标,它显式地迫使模型关注每个检索步骤中正在修改的局部感兴趣区域。我们通过首先提出一种新的视觉图像注意力计算技术来实现这一点,我们称之为多模态梯度注意力(MMGrad),它显式地以修改文本为条件。接下来我们展示如何将 MMGrad 纳入端到端模型训练策略中,通过一个新的学习目标显式地迫使这些 MMGrad 注意力图高亮显示与修改文本对应的正确局部区域。通过使用这一新损失函数训练检索模型,我们展示了通过更好的视觉注意力图实现的改进定位,从而带来了更好的模型可解释性以及标准基准数据集上具有竞争力的定量检索性能。

关键词

引用

@article{arxiv.2308.16649,
  title  = {Learning with Multi-modal Gradient Attention for Explainable Composed Image Retrieval},
  author = {Prateksha Udhayanan and Srikrishna Karanam and Balaji Vasan Srinivasan},
  journal= {arXiv preprint arXiv:2308.16649},
  year   = {2023}
}