VisualBERT:一种简单且高效的视觉与语言基线
计算机视觉与模式识别
2019-08-12 v1 计算与语言
机器学习
摘要
我们提出VisualBERT,一种用于建模广泛视觉与语言任务的简单灵活框架。VisualBERT由一堆Transformer层组成,通过自注意力将输入文本的元素与关联输入图像中的区域隐式对齐。我们进一步提出两个基于视觉的语言模型目标,用于在图像描述数据上预训练VisualBERT。在包括VQA、VCR、NLVR2和Flickr30K在内的四个视觉与语言任务上的实验表明,VisualBERT在显著更简单的同时优于或与最先进模型媲美。进一步分析表明,VisualBERT无需任何显式监督即可将语言元素定位到图像区域,甚至对句法关系敏感,例如跟踪动词与其论元对应图像区域之间的关联。
关键词
引用
@article{arxiv.1908.03557,
title = {VisualBERT: A Simple and Performant Baseline for Vision and Language},
author = {Liunian Harold Li and Mark Yatskar and Da Yin and Cho-Jui Hsieh and Kai-Wei Chang},
journal= {arXiv preprint arXiv:1908.03557},
year = {2019}
}
备注
Work in Progress