中文

E2E-VLP:由视觉学习增强的端到端视觉-语言预训练

计算机视觉与模式识别 2021-06-07 v2 人工智能 计算与语言

摘要

基于大规模图文对上的视觉-语言预训练(VLP)已在跨模态下游任务中取得巨大成功。现有大多数预训练方法主要采用两步训练流程:首先使用预训练的目标检测器提取基于区域的特征,然后将图像表示与文本嵌入拼接作为 Transformer 的输入进行训练。然而,这些方法面临使用特定目标检测器的任务相关视觉表示进行通用跨模态理解的问题,以及两阶段流程的计算低效问题。本文中,我们提出了首个用于视觉-语言理解与生成的端到端视觉-语言预训练模型,即 E2E-VLP,其中我们构建了一个统一的 Transformer 框架来联合学习视觉表示以及图像与文本之间的语义对齐。我们将目标检测与图像描述任务以统一的 Transformer 编码器-解码器架构融入预训练以增强视觉学习。我们在公认的视觉-语言下游任务上进行了大量实验,以证明这一新颖 VLP 范式的有效性。

关键词

引用

@article{arxiv.2106.01804,
  title  = {E2E-VLP: End-to-End Vision-Language Pre-training Enhanced by Visual Learning},
  author = {Haiyang Xu and Ming Yan and Chenliang Li and Bin Bi and Songfang Huang and Wenming Xiao and Fei Huang},
  journal= {arXiv preprint arXiv:2106.01804},
  year   = {2021}
}

备注

ACL2021 main conference