基于视觉语言基础模型的视角整合与配准用于图像变化理解
计算机视觉与模式识别
2023-09-18 v1
摘要
近年来,预训练的视觉语言基础模型(VLFM)的发展在许多任务中取得了显著性能。然而,这些模型往往具有较强的单图像理解能力,但缺乏理解多张图像的能力。因此,它们无法直接应用于图像变化理解(ICU),该任务要求模型捕捉多张图像之间的实际变化并用语言描述。在本文中,我们发现现有 VLFM 直接应用于 ICU 时表现不佳,原因如下:(1)VLFM 通常学习单张图像的全局表示,而 ICU 需要捕捉多张图像之间的细微差异。(2)VLFM 的 ICU 性能受视角变化影响显著,这是由视角变化时物体间关系改变所致。为解决这些问题,我们提出了一种视角整合与配准方法。具体而言,我们引入了一种融合适配器图像编码器,通过插入设计的可训练适配器和融合适配器来微调预训练编码器,以有效捕捉图像对之间的细微差异。此外,设计了视角配准流和语义强调模块,分别用于减少视觉和语义空间中视角变化引起的性能退化。在 CLEVR-Change 和 Spot-the-Diff 上的实验结果表明,我们的方法在所有指标上均达到了最先进的性能。
引用
@article{arxiv.2309.08585,
title = {Viewpoint Integration and Registration with Vision Language Foundation Model for Image Change Understanding},
author = {Xiaonan Lu and Jianlong Yuan and Ruigang Niu and Yuan Hu and Fan Wang},
journal= {arXiv preprint arXiv:2309.08585},
year = {2023}
}