Answer-Me:多任务开放词汇视觉问答
计算机视觉与模式识别
2022-12-02 v2
摘要
我们提出 Answer-Me,一个任务感知的多任务框架,它统一了多种问答任务,例如视觉问答、视觉蕴涵、视觉推理。与之前使用对比或生成式描述训练的工作不同,我们提出了一种新颖而简单的方案来预训练一个视觉-语言联合模型,该模型同样是多任务的。预训练仅使用带噪声的图像描述数据,并被构建为端到端地使用整个架构,同时包含一个强大的语言编码器和解码器。我们的结果显示了最先进的性能、零样本泛化能力、对遗忘的鲁棒性,以及在多种问答任务上具有竞争力的单任务结果。我们的多任务混合训练从具有不同问题意图的任务中学习,因此泛化更好,包括在零样本视觉-语言任务上。我们在具有挑战性的多任务和开放词汇设定下,以及跨多种数据集和任务(如 VQA2.0、SNLI-VE、NLVR2、GQA)进行了实验。我们观察到所提出的方法能够泛化到未见的任务,并且更多样的混合会带来已知和 novel 任务上更高的准确率。
引用
@article{arxiv.2205.00949,
title = {Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering},
author = {AJ Piergiovanni and Wei Li and Weicheng Kuo and Mohammad Saffar and Fred Bertsch and Anelia Angelova},
journal= {arXiv preprint arXiv:2205.00949},
year = {2022}
}