中文

VL-BEiT:生成式视觉-语言预训练

计算机视觉与模式识别 2022-09-07 v2 计算与语言

摘要

我们引入一种称为 VL-BEiT 的视觉-语言基础模型,其为通过生成式预训练学习的双向多模态 Transformer。我们的极简方案使用共享 Transformer 对单模态与多模态数据执行掩码预测。具体地,我们对图像-文本对执行掩码视觉-语言建模,对文本执行掩码语言建模,对图像执行掩码图像建模。VL-BEiT 以单一统一预训练任务、单一共享骨干与单阶段训练从零学起。我们的方法概念简洁且经验有效。实验结果表明 VL-BEiT 在各种视觉-语言基准(如视觉问答、视觉推理与图像-文本检索)上取得强劲结果。此外,我们的方法学到可迁移视觉特征,在图像分类与语义分割上取得具竞争力的性能。

关键词

引用

@article{arxiv.2206.01127,
  title  = {VL-BEiT: Generative Vision-Language Pretraining},
  author = {Hangbo Bao and Wenhui Wang and Li Dong and Furu Wei},
  journal= {arXiv preprint arXiv:2206.01127},
  year   = {2022}
}