中文

探究模态间交互:基于自注意力的视觉语言预训练视觉解析

计算机视觉与模式识别 2021-11-10 v4

摘要

视觉-语言预训练(VLP)旨在从图文对中学习多模态表示,并以微调方式为下游视觉-语言任务服务。主流 VLP 模型采用 CNN-Transformer 架构,用 CNN 嵌入图像,再用 Transformer 对齐图像与文本。视觉内容间的视觉关系在图像理解中起重要作用,是模态间对齐学习的基础。然而,由于局部感受野在建模长程依赖上的不足,CNN 在视觉关系学习上存在局限。因此,学习视觉关系与模态间对齐这两个目标被封装于同一 Transformer 网络中。此类设计可能因忽视各目标的特性而限制 Transformer 中的模态间对齐学习。为此,我们提出一种用于 VLP 的全 Transformer 视觉嵌入,以更好地学习视觉关系并进一步促进模态间对齐。具体而言,我们提出名为模态间流(IMF)的度量来衡量视觉与语言模态间的交互(即模态间)。我们还设计了 Transformer 中名为掩码特征回归(MFR)的新型掩码优化机制,以进一步促进模态间学习。据我们所知,这是首个探索 Transformer 在 VLP 中视觉特征学习益处的研究。我们在广泛的视觉-语言任务上验证了方法,包括图文检索、视觉问答(VQA)、视觉蕴含与视觉推理。我们的方法不仅超越了最先进的 VLP 性能,也在 IMF 度量上展现出优势。

关键词

引用

@article{arxiv.2106.13488,
  title  = {Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training},
  author = {Hongwei Xue and Yupan Huang and Bei Liu and Houwen Peng and Jianlong Fu and Houqiang Li and Jiebo Luo},
  journal= {arXiv preprint arXiv:2106.13488},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021