中文

VITR:以关系聚焦学习增强视觉Transformer的跨模态信息检索方法

计算机视觉与模式识别 2023-07-31 v3

摘要

用户查询中所表达的关系对跨模态信息检索至关重要。以关系聚焦的跨模态检索旨在检索与这些关系相对应的信息,从而实现跨不同模态的有效检索。预训练网络(如对比语言-图像预训练(CLIP))因其在各类跨模态学习任务中的卓越表现而备受关注与赞誉。然而,这些网络中使用的视觉Transformer(ViT)在聚焦图像区域关系方面的能力有限。具体而言,ViT被训练为在全局层面将图像与相关描述相匹配,而未考虑图像区域与描述之间的对齐。本文提出VITR,一种基于局部编码器提取并推理图像区域关系以增强ViT的新型网络。VITR由两个关键组件构成。首先,它扩展了基于ViT的跨模态网络的能力,使其能提取并推理图像中存在的区域关系。其次,VITR引入一个融合模块,将推理结果与全局知识结合以预测图像与描述间的相似度分数。所提出的VITR网络在关系聚焦跨模态信息检索任务上通过实验进行了评估。基于RefCOCOg、CLEVR和Flickr30K数据集的分析结果表明,所提出的VITR网络在图像到文本与文本到图像检索上持续优于SOTA网络。

关键词

引用

@article{arxiv.2302.06350,
  title  = {VITR: Augmenting Vision Transformers with Relation-Focused Learning for Cross-Modal Information Retrieval},
  author = {Yan Gong and Georgina Cosma and Axel Finke},
  journal= {arXiv preprint arXiv:2302.06350},
  year   = {2023}
}