VL-BEiT:生成式视觉-语言预训练
计算机视觉与模式识别
2022-09-07 v2 计算与语言
摘要
我们引入一种称为 VL-BEiT 的视觉-语言基础模型,其为通过生成式预训练学习的双向多模态 Transformer。我们的极简方案使用共享 Transformer 对单模态与多模态数据执行掩码预测。具体地,我们对图像-文本对执行掩码视觉-语言建模,对文本执行掩码语言建模,对图像执行掩码图像建模。VL-BEiT 以单一统一预训练任务、单一共享骨干与单阶段训练从零学起。我们的方法概念简洁且经验有效。实验结果表明 VL-BEiT 在各种视觉-语言基准(如视觉问答、视觉推理与图像-文本检索)上取得强劲结果。此外,我们的方法学到可迁移视觉特征,在图像分类与语义分割上取得具竞争力的性能。
引用
@article{arxiv.2206.01127,
title = {VL-BEiT: Generative Vision-Language Pretraining},
author = {Hangbo Bao and Wenhui Wang and Li Dong and Furu Wei},
journal= {arXiv preprint arXiv:2206.01127},
year = {2022}
}