中文

GRIT-VLP:用于高效视觉与语言预训练的分组小批量采样

计算机视觉与模式识别 2022-08-09 v1

摘要

目前大多数现有的视觉与语言预训练(VLP)方法主要集中于如何提取和对齐视觉与文本特征。与主流VLP方法不同,我们强调预训练期间两个常规应用的步骤对预训练模型的性能有关键影响:用于图文匹配(ITM)的批内难负样本采样,以及为掩码语言建模(MLM)设定较大的掩码概率。在通过实验展示上述两个步骤出人意料的有效性之后,我们系统地设计了我们的GRIT-VLP,它自适应地对小批量进行采样,以更有效地挖掘ITM的难负样本,同时保持预训练的计算成本。我们的方法由三个组件构成:1)GRouped mIni-baTch采样(GRIT)策略,将相似样本收集到一个小批量中;2)用于提升挖掘能力的ITC一致性损失;3)为MLM扩大的掩码概率。因此,我们展示了我们的GRIT-VLP在各种下游任务上以低得多的计算成本达到了新的最先进性能。此外,我们证明我们的模型本质上与先前的最先进模型ALBEF相当,仅需在相同训练数据上以三分之一的训练轮数。代码可在 https://github.com/jaeseokbyun/GRIT-VLP 获取。

关键词

引用

@article{arxiv.2208.04060,
  title  = {GRIT-VLP: Grouped Mini-batch Sampling for Efficient Vision and Language Pre-training},
  author = {Jaeseok Byun and Taebaek Hwang and Jianlong Fu and Taesup Moon},
  journal= {arXiv preprint arXiv:2208.04060},
  year   = {2022}
}