中文

VLMixer:通过跨模态 CutMix 进行非配对视觉-语言预训练

计算机视觉与模式识别 2022-06-20 v1

摘要

现有的视觉-语言预训练 (VLP) 方法主要依赖于成对的图像-文本数据集,这些数据集要么由大量人工标注,要么从互联网爬取并经过精细的数据清洗技术处理。为了减少对良好对齐的图像-文本对的依赖,直接利用大规模纯文本和纯图像语料库是很有前景的。本文提出了一种数据增强方法,称为跨模态 CutMix (CMC),用于在非配对 VLP 中进行隐式跨模态对齐学习。具体来说,CMC 将文本视图中的自然句子转换为多模态视图,其中句子中视觉基础的词被随机替换为具有相似语义的多样化图像块。所提出的 CMC 有几个吸引人的特性。首先,它在保持语义完整的同时增强了数据多样性,以应对对齐数据稀缺的问题;其次,通过在单模态数据上附加跨模态噪声,它引导模型学习跨模态的令牌级交互,以实现更好的去噪。此外,我们提出了一种新的非配对 VLP 方法,称为 VLMixer,它将 CMC 与对比学习相结合,将单模态和多模态视图拉近,以实现不同模态间更好的实例级对齐。在五个下游任务上的大量实验表明,VLMixer 可以超越先前最先进的非配对 VLP 方法。

关键词

引用

@article{arxiv.2206.08919,
  title  = {VLMixer: Unpaired Vision-Language Pre-training via Cross-Modal CutMix},
  author = {Teng Wang and Wenhao Jiang and Zhichao Lu and Feng Zheng and Ran Cheng and Chengguo Yin and Ping Luo},
  journal= {arXiv preprint arXiv:2206.08919},
  year   = {2022}
}