用于多模态表示学习的掩码视觉与语言建模
计算机视觉与模式识别
2023-03-16 v2 计算与语言
机器学习
摘要
本文研究如何在视觉与语言(V+L)表示学习中运用掩码信号建模。我们不是独立地开发掩码语言建模(MLM)和掩码图像建模(MIM),而是提出构建联合的掩码视觉与语言建模,其中某一模态的掩码信号借助另一模态进行重建。其动机在于图文配对数据的本质:图像与文本以不同格式传达几乎相同的信息。以一个模态为条件对另一模态的掩码信号进行重建,也可隐式地学习语言词元与图像块之间的跨模态对齐。我们在多种 V+L 任务上的实验表明,所提方法与常见的 V+L 对齐损失结合,在百万级预训练数据规模下取得了当前最优(state-of-the-art)性能。同时,在有限数据场景下,我们以显著优势超越其他竞争对手。
引用
@article{arxiv.2208.02131,
title = {Masked Vision and Language Modeling for Multi-modal Representation Learning},
author = {Gukyeong Kwon and Zhaowei Cai and Avinash Ravichandran and Erhan Bas and Rahul Bhotika and Stefano Soatto},
journal= {arXiv preprint arXiv:2208.02131},
year = {2023}
}
备注
International Conference on Learning Representations (ICLR) 2023