中文

融合前对齐:基于动量蒸馏的视觉与语言表示学习

计算机视觉与模式识别 2021-10-08 v2 人工智能

摘要

大规模的视觉与语言表示学习已在多种视觉-语言任务上展现出令人鼓舞的提升。现有多数方法采用基于 transformer 的多模态编码器来联合建模视觉 token(基于区域的图像特征)与词语 token。由于视觉 token 与词语 token 未对齐,多模态编码器难以学习图像-文本交互。本文引入一种对比损失,在通过跨模态注意力融合图像与文本表示之前先对其对齐(ALBEF),从而实现更具依据性的视觉与语言表示学习。与多数现有方法不同,我们的方法无需边界框标注,也无需高分辨率图像。为改进从含噪网络数据中学习,我们提出动量蒸馏这一自训练方法,从动量模型生成的伪目标中学习。我们从互信息最大化的角度对 ALBEF 进行理论分析,表明不同的训练任务可解释为对图像-文本对生成视图的不同方式。ALBEF 在多个下游视觉-语言任务上取得了最先进的性能。在图像-文本检索上,ALBEF 优于那些在数量级更大数据集上预训练的方法。在 VQA 与 NLVR2^2 上,ALBEF 相比最先进水平分别取得 2.37% 与 3.84% 的绝对提升,同时具有更快的推理速度。代码与预训练模型见 https://github.com/salesforce/ALBEF/。

关键词

引用

@article{arxiv.2107.07651,
  title  = {Align before Fuse: Vision and Language Representation Learning with Momentum Distillation},
  author = {Junnan Li and Ramprasaath R. Selvaraju and Akhilesh Deepak Gotmare and Shafiq Joty and Caiming Xiong and Steven Hoi},
  journal= {arXiv preprint arXiv:2107.07651},
  year   = {2021}
}