中文

mPLUG:基于跨模态跳跃连接的高效视觉-语言学习

计算与语言 2023-07-06 v2 计算机视觉与模式识别

摘要

大规模预训练基础模型已成为构建人工智能(AI)系统的一个新兴范式,其可快速适配广泛的下游任务。本文提出 mPLUG,一种用于跨模态理解与生成的新型视觉-语言基础模型。大多数现有预训练模型受限于跨模态对齐中长视觉序列带来的低计算效率与信息不对称问题。为解决这些问题,mPLUG 引入了一种带有新颖跨模态跳跃连接的高效视觉-语言架构,其创建了层间捷径,在视觉侧跳过若干层耗时的全自注意力计算。mPLUG 在大规模图文对上以判别与生成目标进行端到端预训练。它在图像描述、图文检索、视觉定位与视觉问答等广泛视觉-语言下游任务上取得了最先进结果。mPLUG 在直接迁移到多个视频-语言任务时也展现出强大的零样本迁移能力。

关键词

引用

@article{arxiv.2205.12005,
  title  = {mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections},
  author = {Chenliang Li and Haiyang Xu and Junfeng Tian and Wei Wang and Ming Yan and Bin Bi and Jiabo Ye and Hehong Chen and Guohai Xu and Zheng Cao and Ji Zhang and Songfang Huang and Fei Huang and Jingren Zhou and Luo Si},
  journal= {arXiv preprint arXiv:2205.12005},
  year   = {2023}
}