通过联合学习提问者与密集描述器增强视觉-语言预训练
计算机视觉与模式识别
2023-08-08 v2 人工智能
计算与语言
多媒体
摘要
大型预训练多模态模型已在一系列下游任务中展现出显著成功,包括图像描述、图文检索、视觉问答(VQA)等。然而,许多方法依赖从网络收集的图文对作为预训练数据,却忽视了视觉与语言模态间细粒度特征对齐的需求,而这需要图像与语言表达的详细理解。虽然将VQA与密集描述(DC)整合进预训练可解决该问题,但获取图像-问题-答案以及图像-位置-描述三元组具有挑战性且耗时。此外,由于人工数据收集与标注工作,公开可用的VQA与密集描述数据集通常规模有限。本文提出一种称为联合QA与DC生成(JADE)的新方法,其利用预训练多模态模型与易爬取的图文对自动生成并过滤大规模VQA与密集描述数据集。我们将该方法应用于Conceptual Caption(CC3M)数据集,生成名为CC3M-QA-DC的新数据集。实验表明,当以多任务方式用于预训练时,CC3M-QA-DC可提升多种骨干网络在各类下游任务上的性能。此外,我们生成的CC3M-QA-DC可与更大型图文数据集(如CC15M)结合,并取得与使用了远多数据的模型相竞争的成果。代码与数据集发布于 https://github.com/johncaged/OPT_Questioner。
引用
@article{arxiv.2305.11769,
title = {Enhancing Vision-Language Pre-Training with Jointly Learned Questioner and Dense Captioner},
author = {Zikang Liu and Sihan Chen and Longteng Guo and Handong Li and Xingjian He and Jing Liu},
journal= {arXiv preprint arXiv:2305.11769},
year = {2023}
}
备注
12 pages. Accepted by ACM MM '23