骨干网络中融合的粗到细视觉-语言预训练
计算机视觉与模式识别
2022-11-21 v2 计算与语言
机器学习
摘要
视觉-语言(VL)预训练近期受到相当关注。然而,多数现有端到端预训练方法要么仅旨在处理测试图像高层理解的 VL 任务(如图像-文本检索、视觉问答(VQA)和图像描述),要么仅面向短语定位与目标检测等任务的区域级理解。我们提出 FIBER(基于骨干融合的 Transformer,Fusion-In-the-Backbone-based transformER),一种可无缝处理这两类任务的新型 VL 模型架构。FIBER 不在单模态骨干后设置专用融合 transformer 层,而是通过将交叉注意力插入图像与文本骨干,将多模态融合深入推入模型,从而在显存与性能上带来收益。此外,不同于以往仅在图像-文本数据或带框级标注的细粒度数据上预训练,我们提出一种高效利用这两类数据的两阶段预训练策略:(i)基于图像-文本数据的粗粒度预训练;随后(ii)基于图像-文本-框数据的细粒度预训练。我们在广泛 VL 任务上开展综合实验,涵盖 VQA、图像描述、检索,到短语定位、指代表达理解和目标检测。借助深度多模态融合与两阶段预训练,FIBER 在所有任务上相较强基线均提供一致性能提升,常超越使用数据量多出数个量级的方法。代码见 https://github.com/microsoft/FIBER。
引用
@article{arxiv.2206.07643,
title = {Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone},
author = {Zi-Yi Dou and Aishwarya Kamath and Zhe Gan and Pengchuan Zhang and Jianfeng Wang and Linjie Li and Zicheng Liu and Ce Liu and Yann LeCun and Nanyun Peng and Jianfeng Gao and Lijuan Wang},
journal= {arXiv preprint arXiv:2206.07643},
year = {2022}
}
备注
NeurIPS 2022. Project Website: https://ashkamath.github.io/FIBER_page