多模态预训练揭秘:视觉与语言BERT的元分析与统一框架
计算与语言
2021-06-01 v2 计算机视觉与模式识别
摘要
大规模预训练与任务特定微调现已成为计算机视觉与自然语言处理中诸多任务的标准方法。近来,为应对人工智能这两个关键领域交叉处的挑战,提出了大量用于预训练视觉与语言BERT的方法。这些模型可分为单流或双流编码器两类。我们研究了这两类之间的差异,并展示了它们如何在单一理论框架下统一。随后我们进行了受控实验,以辨明五个V&L BERT之间的经验性差异。实验表明,训练数据与超参数对所报告结果的大部分差异负责,但也揭示嵌入层在这些庞大模型中起着关键作用。
引用
@article{arxiv.2011.15124,
title = {Multimodal Pretraining Unmasked: A Meta-Analysis and a Unified Framework of Vision-and-Language BERTs},
author = {Emanuele Bugliarello and Ryan Cotterell and Naoaki Okazaki and Desmond Elliott},
journal= {arXiv preprint arXiv:2011.15124},
year = {2021}
}
备注
To appear in TACL 2021