VL-BERT:通用视觉-语言表征的预训练
计算机视觉与模式识别
2020-02-19 v4 计算与语言
机器学习
摘要
我们为视觉-语言任务引入一种新的可预训练通用表征,称为视觉-语言 BERT(简称 VL-BERT)。VL-BERT 采用简单而强大的 Transformer 模型作为主干,并将其扩展以同时接受视觉和语言嵌入特征作为输入。其中,输入的每个元素要么是来自输入句子的一个词,要么是来自输入图像的一个感兴趣区域(RoI)。它被设计为适用于大多数视觉-语言下游任务。为了更好地利用这一通用表征,我们在大规模 Conceptual Captions 数据集以及纯文本语料库上对 VL-BERT 进行预训练。广泛的实证分析表明,预训练过程能更好地对齐视觉-语言线索,并有益于下游任务,如视觉常识推理、视觉问答和指代表达理解。值得注意的是,VL-BERT 在 VCR 基准排行榜上取得了单模型第一名。代码已发布于 \url{https://github.com/jackroos/VL-BERT}。
引用
@article{arxiv.1908.08530,
title = {VL-BERT: Pre-training of Generic Visual-Linguistic Representations},
author = {Weijie Su and Xizhou Zhu and Yue Cao and Bin Li and Lewei Lu and Furu Wei and Jifeng Dai},
journal= {arXiv preprint arXiv:1908.08530},
year = {2020}
}
备注
Accepted by ICLR 2020