中文

ContextBLIP:面向语言复杂描述对比图像检索的双重上下文对齐

计算机视觉与模式识别 2024-05-30 v1 多媒体

摘要

基于上下文描述的图像检索(IRCD)旨在根据语言复杂的文本在一组最小对比候选图像中识别出一幅图像。尽管VLM取得了成功,但在IRCD中它们仍然远远落后于人类表现。主要挑战在于对齐两种模态中的关键上下文线索,这些微妙的线索隐藏在多个对比图像的微小区域以及文本描述复杂的语言结构中。这促使我们提出ContextBLIP,一种简单而有效的方法,依赖于双重上下文对齐方案来解决具有挑战性的IRCD。具体来说,1)我们的模型包括一个多尺度适配器、一个匹配损失和一个文本引导的掩码损失。适配器学习捕捉细粒度的视觉线索。这两个损失为适配器提供迭代监督,逐步将单个图像的焦点区域突出显示给关键文本线索。我们将这种方式称为上下文内对齐。2)然后,ContextBLIP进一步采用上下文间编码器来学习候选图像之间的依赖关系,促进文本与多个图像之间的对齐。我们将这一步称为上下文间对齐。因此,每个模态中隐藏的细微线索可以有效地对齐。在两个基准上的实验显示了我们方法的优越性。我们观察到,尽管ContextBLIP的参数数量少约7500倍,但它可以产生与GPT-4V相当的结果。

关键词

引用

@article{arxiv.2405.19226,
  title  = {ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions},
  author = {Honglin Lin and Siyu Li and Guoshun Nan and Chaoyue Tang and Xueting Wang and Jingxin Xu and Rong Yankai and Zhili Zhou and Yutong Gao and Qimei Cui and Xiaofeng Tao},
  journal= {arXiv preprint arXiv:2405.19226},
  year   = {2024}
}

备注

Accepted in ACL 2024 Findings