中文

用于多模态表示学习的掩码视觉与语言建模

计算机视觉与模式识别 2023-03-16 v2 计算与语言 机器学习

摘要

本文研究如何在视觉与语言(V+L)表示学习中运用掩码信号建模。我们不是独立地开发掩码语言建模(MLM)和掩码图像建模(MIM),而是提出构建联合的掩码视觉与语言建模,其中某一模态的掩码信号借助另一模态进行重建。其动机在于图文配对数据的本质:图像与文本以不同格式传达几乎相同的信息。以一个模态为条件对另一模态的掩码信号进行重建,也可隐式地学习语言词元与图像块之间的跨模态对齐。我们在多种 V+L 任务上的实验表明,所提方法与常见的 V+L 对齐损失结合,在百万级预训练数据规模下取得了当前最优(state-of-the-art)性能。同时,在有限数据场景下,我们以显著优势超越其他竞争对手。

关键词

引用

@article{arxiv.2208.02131,
  title  = {Masked Vision and Language Modeling for Multi-modal Representation Learning},
  author = {Gukyeong Kwon and Zhaowei Cai and Avinash Ravichandran and Erhan Bas and Rahul Bhotika and Stefano Soatto},
  journal= {arXiv preprint arXiv:2208.02131},
  year   = {2023}
}

备注

International Conference on Learning Representations (ICLR) 2023