我们预训练对了吗?深入探究视觉-语言预训练
计算机视觉与模式识别
2020-04-21 v1 计算与语言
摘要
近期大量工作提出预训练通用的视觉-语言表示,然后在下游视觉和语言任务上进行微调。虽然架构和目标函数的设计选择已受到关注,但预训练数据集的选择却很少被关注。在这项工作中,我们质疑了文献中的一些默认选择。例如,我们系统地研究了预训练数据集领域(文本和视觉)与下游领域之间的相似度变化如何影响性能。令人惊讶的是,我们表明,在更接近下游任务(例如VQA v2)的领域中自动生成的数据,比领域略有不同的“自然”数据(例如Conceptual Captions)是更好的预训练选择。另一方面,一些看似合理的预训练数据集选择被发现对某些下游任务完全无效。这表明,尽管近期有诸多努力,视觉与语言预训练尚未完全“开箱即用”。总体而言,作为我们研究的一个副产品,我们发现预训练中简单的设计选择可以帮助我们在不改变架构的情况下,在下游任务上取得接近最先进水平的结果。
引用
@article{arxiv.2004.08744,
title = {Are we pretraining it right? Digging deeper into visio-linguistic pretraining},
author = {Amanpreet Singh and Vedanuj Goswami and Devi Parikh},
journal= {arXiv preprint arXiv:2004.08744},
year = {2020}
}
备注
23 pages, 6 figures. First two authors contributed equally. More info at https://github.com/facebookresearch/pythia