VQA 中视觉瓶颈的实验研究
计算机视觉与模式识别
2022-02-15 v1
摘要
如同许多结合视觉与语言的任务,两种模态在视觉问答(VQA)中都起着关键作用。为妥善解决该任务,给定模型应同时理解所提供图像的内容和问题性质。虽然模态间的融合——该问题的另一明显重要部分——已被高度研究,视觉部分在近期工作中较少受到关注。当前 VQA 的先进方法主要依赖现成目标检测器给出一组目标边界框和嵌入,随后通过推理模块与问题词嵌入结合。本文我们对 VQA 中的视觉瓶颈进行了深入研究,实验考察了从图像提取的视觉目标的数量与质量。我们还研究了两种将回答问题所需目标信息纳入推理模块(直接纳入,以及更早地在目标选择阶段纳入)方法的影响。本工作凸显了视觉在 VQA 背景下的重要性,以及使 VQA 中使用的视觉方法适配当前任务的价值。
引用
@article{arxiv.2202.06858,
title = {An experimental study of the vision-bottleneck in VQA},
author = {Pierre Marza and Corentin Kervadec and Grigory Antipov and Moez Baccouche and Christian Wolf},
journal= {arXiv preprint arXiv:2202.06858},
year = {2022}
}