中文

ERNIE-ViL 2.0:用于图像-文本预训练的多视角对比学习

计算机视觉与模式识别 2022-10-03 v1

摘要

近期基于双编码器的视觉-语言预训练(VLP)模型因其在各类跨模态任务上的优越性能与高计算效率,受到学术界与工业界的广泛关注。它们试图在图像-文本对上使用对比学习来学习跨模态表示,然而所构建的模态间关联仅依赖每模态的单一视角。实际上,一幅图像或一段文本包含多种潜在视角,正如人类可通过多样描述或照片捕捉真实场景。本文提出 ERNIE-ViL 2.0,一种多视角对比学习框架,同时构建多样视角间的模态内与模态间关联,旨在学习更鲁棒的跨模态表示。具体而言,我们在各模态内构建多个视角以学习模态内关联,从而增强单模态表示。除固有的视觉/文本视角外,我们将目标标签序列构建为一种特殊文本视角,以缩小噪声图像-文本对上的跨模态语义鸿沟。使用 29M 公开数据集预训练,ERNIE-ViL 2.0 在英语跨模态检索上取得有竞争力的结果。此外,为将方法推广至中文跨模态任务,我们将预训练数据集扩展至 1.5B 中文图像-文本对来训练 ERNIE-ViL 2.0,相较此前中文跨模态检索的 SOTA 结果取得显著提升。我们在 https://github.com/PaddlePaddle/ERNIE 发布预训练模型。

关键词

引用

@article{arxiv.2209.15270,
  title  = {ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training},
  author = {Bin Shan and Weichong Yin and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2209.15270},
  year   = {2022}
}

备注

14 pages, 6 figures