IQ-VQA:智能视觉问答
计算机视觉与模式识别
2020-07-10 v1 计算与语言
摘要
尽管视觉问答领域取得了巨大进展,但当今的模型仍然倾向于不一致且脆弱。为此,我们提出了一种与模型无关的循环框架,可提高任何 VQA 架构的一致性和鲁棒性。我们训练模型回答原始问题,根据答案生成蕴含,然后也学习正确回答生成的蕴含。作为循环框架的一部分,我们提出了一种新颖的蕴含生成器,它可以从任何问答对中生成蕴含问题。作为未来一致性研究工作的基线,我们提供了一个新的人工标注的 VQA-Implications 数据集。该数据集包含约 3 万个问题,涵盖 3 种类型的蕴含——逻辑等价、必要条件和互斥——由 VQA v2.0 验证集构建而成。我们表明,我们的框架在基于规则的数据集上将 VQA 模型的一致性提高了约 15%,在 VQA-Implications 数据集上提高了约 7%,并在不降低性能的情况下将鲁棒性提高了约 2%。此外,我们还定量展示了注意力图的改善,突出了更好的视觉与语言多模态理解。
引用
@article{arxiv.2007.04422,
title = {IQ-VQA: Intelligent Visual Question Answering},
author = {Vatsal Goel and Mohit Chandak and Ashish Anand and Prithwijit Guha},
journal= {arXiv preprint arXiv:2007.04422},
year = {2020}
}