WeaQA:基于图像描述的视觉问答弱监督方法
计算机视觉与模式识别
2021-05-31 v2 计算与语言
摘要
训练视觉问答(VQA)模型的方法论假定具有人工标注的“图像-问题-答案”(I-Q-A)三元组的数据集可用。这导致对数据集的严重依赖,以及向新型问题与场景泛化能力的缺失。已有研究表明,此类样本上训练的 VQA 模型会渗透进语言先验,以及由标注者主观性带来的偏差与错误。我们研究模型是否可在无任何人工标注的问答对、仅借助图像及其关联文本描述或字幕的情况下训练。我们提出一种用从字幕程序化生成的合成问答对训练模型的方法。此外,我们展示了空间金字塔图像块作为现有 VQA 模型中密集且昂贵的物体边界框标注的简单而有效替代方案的功效。我们在三个 VQA 基准上的实验证明了该弱监督方法的有效性,尤其在测试语言先验变化下性能的 VQA-CP 挑战上。
引用
@article{arxiv.2012.02356,
title = {WeaQA: Weak Supervision via Captions for Visual Question Answering},
author = {Pratyay Banerjee and Tejas Gokhale and Yezhou Yang and Chitta Baral},
journal= {arXiv preprint arXiv:2012.02356},
year = {2021}
}
备注
Accepted in Findings of ACL 2021