中文

CAVL:学习视觉与语言的对比与自适应表征

计算机视觉与模式识别 2023-04-11 v1 人工智能 机器学习 多媒体

摘要

视觉与语言预训练旨在共同学习视觉与语言表征,并可迁移至视觉-语言下游任务。然而,在预训练阶段存在语言与视觉之间的语义混淆。此外,当前的预训练模型在迁移至下游任务进行微调时往往消耗大量计算资源。在本工作中,我们提出一种简单而有效的方法,用于学习视觉与语言的对比与自适应表征,即 CAVL。具体而言,我们在预训练过程中引入成对对比损失,以学习同一批次中整句与每幅图像之间的对齐。在微调阶段,我们引入两个轻量级自适应网络,以减少模型参数并提升训练速度,从而节省计算资源。我们在六个主要下游任务上评估了 CAVL,包括视觉问答(VQA)、视觉常识推理(VCR)、视觉推理自然语言(NLVR)、区域-短语定位(RPG)、文本-图像检索(TIR)和零样本文本-图像检索(ZS-TIR)。与基线相比,我们取得了更优的性能,并将微调时间大幅减少(特别是减少了 76.17%)。大量实验与消融研究证明了 CAVL 所提出的对比预训练与自适应微调的有效性。

关键词

引用

@article{arxiv.2304.04399,
  title  = {CAVL: Learning Contrastive and Adaptive Representations of Vision and Language},
  author = {Shentong Mo and Jingfei Xia and Ihor Markevych},
  journal= {arXiv preprint arXiv:2304.04399},
  year   = {2023}
}