再次核查:基于视觉蕴涵的渐进式视觉问答
计算机视觉与模式识别
2021-06-10 v1
摘要
尽管复杂的视觉问答模型已取得显著成功,它们往往仅依据问题与答案之间的表层相关性来作答。近来已提出若干方法来解决这一语言先验问题。然而,其中大多数仅根据一个最佳输出预测正确答案,而不核查答案的真实性。此外,它们只探究了图像与问题之间的交互,忽略了候选答案的语义。在本文中,我们提出了一种基于视觉蕴涵的选择-重排序(SAR)渐进式框架。具体而言,我们首先选择与问题或图像相关的候选答案,然后通过视觉蕴涵任务对候选答案重排序,该任务验证图像是否在语义上蕴涵问题与各候选答案的合成陈述。实验结果表明了我们提出框架的有效性,其在 VQA-CP v2 上以 7.55% 的提升建立了新的 SOTA 准确率。
引用
@article{arxiv.2106.04605,
title = {Check It Again: Progressive Visual Question Answering via Visual Entailment},
author = {Qingyi Si and Zheng Lin and Mingyu Zheng and Peng Fu and Weiping Wang},
journal= {arXiv preprint arXiv:2106.04605},
year = {2021}
}
备注
ACL-2021