中文

用于视觉-语言关系对齐的跨模态注意力一致性正则化

计算与语言 2023-07-06 v2 计算机视觉与模式识别 机器学习

摘要

尽管在扩大多模态视觉-语言模型方面取得了近期进展,但已知这些模型在 Winoground 等组合泛化基准上仍然存在困难。我们发现当前视觉-语言模型缺乏的一个关键组成部分是关系级对齐:将文本中的有向语义关系(例如“mug in grass”)与图像中的空间关系(例如杯子相对于草的位置)相匹配的能力。为解决这一问题,我们表明可以通过鼓励从“mug”到“grass”的有向语言注意力(捕获语义关系“in”)与从杯子到草的有向视觉注意力相匹配来强制实现关系对齐。使用跨模态注意力将词元及其对应对象进行软识别。我们证明,在跨模态注意力矩阵提供的“基变换”下,这种软关系对齐的概念等价于在视觉和语言注意力矩阵之间强制施加一致性。直观上,我们的方法将视觉注意力投影到语言注意力空间以计算其与实际语言注意力的散度,反之亦然。我们将跨模态注意力一致性正则化(CACR)损失应用于 UNITER,并改进了在 Winoground 上的最先进方法。

关键词

引用

@article{arxiv.2212.10549,
  title  = {Cross-modal Attention Congruence Regularization for Vision-Language Relation Alignment},
  author = {Rohan Pandey and Rulin Shao and Paul Pu Liang and Ruslan Salakhutdinov and Louis-Philippe Morency},
  journal= {arXiv preprint arXiv:2212.10549},
  year   = {2023}
}

备注

ACL 2023