稠密对比视觉-语言预训练
计算机视觉与模式识别
2021-09-27 v1 计算与语言
摘要
受 BERT 成功的启发,已有若干多模态表示学习方法被提出,用于联合表示图像与文本。这些方法通过从大规模多模态预训练中捕获高层语义信息而取得优越性能。具体而言,LXMERT 和 UNITER 采用视觉区域特征回归与标签分类作为预文本任务。然而,由于视觉特征已在具有有限且不一致的语义标注的众包数据集上进行了预训练,它们往往受到噪声标签与稀疏语义标注问题的困扰。为克服这些问题,我们提出了无偏的稠密对比视觉-语言预训练(DCVLP),其以无需标注的跨模态区域对比学习替代区域回归与分类。我们设计了两种数据增强策略(掩码扰动与 intra-/inter-对抗扰动)以提升对比学习中所用负样本的质量。总体而言,DCVLP 允许在独立于任何目标标注的自监督设定下进行跨模态稠密区域对比学习。我们将我们的方法与先前的视觉-语言预训练框架进行比较,以验证稠密对比学习在多模态表示学习上的优越性。
引用
@article{arxiv.2109.11778,
title = {Dense Contrastive Visual-Linguistic Pretraining},
author = {Lei Shi and Kai Shuang and Shijie Geng and Peng Gao and Zuohui Fu and Gerard de Melo and Yunpeng Chen and Sen Su},
journal= {arXiv preprint arXiv:2109.11778},
year = {2021}
}
备注
Accepted by ACM Multimedia 2021. arXiv admin note: text overlap with arXiv:2007.13135