ViLBERT:面向视觉与语言任务的与任务无关视觉语言表征预训练
计算机视觉与模式识别
2019-08-07 v1 计算与语言
摘要
我们提出 ViLBERT(Vision-and-Language BERT 的简称),一种用于学习与任务无关的图文内容与自然语言联合表征的模型。我们将流行的 BERT 架构扩展为多模态双流模型,通过共注意力 transformer 层在独立处理视觉与文本输入的两个流中进行交互。我们在大规模自动收集的 Conceptual Captions 数据集上通过两个代理任务对模型进行预训练,随后仅对基础架构做微小改动便将其迁移至多个成熟的视觉与语言任务——视觉问答、视觉常识推理、指代表达式和基于描述的图文检索。我们观察到相比现有任务专用模型在各任务上均有显著提升——并在全部四个任务上达到 state-of-the-art。我们的工作代表着从仅在任务训练中习得视觉与语言对齐,转向将视觉对齐视为可预训练且可迁移的能力。
引用
@article{arxiv.1908.02265,
title = {ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks},
author = {Jiasen Lu and Dhruv Batra and Devi Parikh and Stefan Lee},
journal= {arXiv preprint arXiv:1908.02265},
year = {2019}
}
备注
11 pages, 5 figures