中文

图像-文本-图空间中用于改进视觉-语言组合性的由粗到细对比学习

计算与语言 2023-10-26 v3 计算机视觉与模式识别

摘要

对比训练的视觉-语言模型在视觉与语言表示学习中取得了显著进展,催生了用于各类下游多模态任务的最先进模型。然而,近期研究强调了这些模型在对象、属性及关系上的组合推理能力存在严重局限。场景图已成为一种理解图像组合结构的有效方式,其作为图像的图结构语义表示,包含场景中的对象、属性及其与其他对象的关系。本工作中,我们将从文本解析出的场景图视为图像场景图的代理,提出一种图分解与增强框架,以及图像与文本间由粗到细的对比学习目标,将不同复杂度的句子对齐至同一图像。此外,我们提出了场景图空间中的新颖难负样本挖掘技术,以改进属性绑定与关系理解。通过大量实验,我们证明了方法的有效性:在多个近期提出的基准上显著提升了属性绑定、关系理解、系统泛化与生成能力(例如,相较强基线,系统泛化提升达 18%,关系理解提升 16.5%),同时在各类通用多模态任务上取得与 CLIP 相似或更优的性能。

关键词

引用

@article{arxiv.2305.13812,
  title  = {Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for Improved Vision-Language Compositionality},
  author = {Harman Singh and Pengchuan Zhang and Qifan Wang and Mengjiao Wang and Wenhan Xiong and Jingfei Du and Yu Chen},
  journal= {arXiv preprint arXiv:2305.13812},
  year   = {2023}
}

备注

EMNLP 2023 (long paper, main conference)