中文

端到端视觉与语言 Transformer 训练的实证研究

计算机视觉与模式识别 2022-03-21 v3 计算与语言 机器学习

摘要

视觉与语言(VL)预训练已被证明在各种 VL 下游任务上非常有效。虽然最近的工作表明,完全基于 Transformer 的 VL 模型可以比以前基于区域特征的方法更高效,但它们在下游任务上的性能通常会显著下降。在本文中,我们提出了 METER,一个多模态端到端 TransformER 框架,通过它我们研究如何以端到端方式设计和预训练完全基于 Transformer 的 VL 模型。具体而言,我们沿多个维度剖析模型设计:视觉编码器(如 CLIP-ViT、Swin transformer),文本编码器(如 RoBERTa、DeBERTa),多模态融合模块(如合并注意力与协同注意力),架构设计(如仅编码器与编码器-解码器),以及预训练目标(如掩码图像建模)。我们进行了全面的实验,并就如何训练高性能的 VL transformer 提供了见解。METER 在 VQAv2 test-std 集上仅使用 4M 图像进行预训练便达到了 77.64% 的准确率,超越了最先进的基于区域特征的模型 1.04%,并优于先前最佳的完全基于 Transformer 的模型 1.6%。值得注意的是,当进一步扩大规模时,我们最佳的 VQA 模型达到了 80.54% 的准确率。代码和预训练模型已发布于 https://github.com/zdou0830/METER。

关键词

引用

@article{arxiv.2111.02387,
  title  = {An Empirical Study of Training End-to-End Vision-and-Language Transformers},
  author = {Zi-Yi Dou and Yichong Xu and Zhe Gan and Jianfeng Wang and Shuohang Wang and Lijuan Wang and Chenguang Zhu and Pengchuan Zhang and Lu Yuan and Nanyun Peng and Zicheng Liu and Michael Zeng},
  journal= {arXiv preprint arXiv:2111.02387},
  year   = {2022}
}

备注

CVPR 2022