中文

视觉常识推理中的联合回答与解释

计算机视觉与模式识别 2023-07-26 v2

摘要

视觉常识推理(VCR)被视为视觉问答(VQA)的一个具挑战性的扩展,致力于追求更高层次的视觉理解。它由两个不可或缺的过程组成:给定图像上的问题回答与用于答案解释的理由推断。多年来,多种解决 VCR 的方法提升了基准数据集上的性能。尽管这些方法意义重大,它们常将两过程分离处理,从而将 VCR 分解为两个不相关的 VQA 实例。结果,问题回答与理由推断之间的关键联系被切断,致使现有努力在视觉推理上不够忠实。为实证研究此问题,我们从语言捷径与泛化能力两方面进行深度探索以验证此种处理的缺陷。基于发现,本文提出一个即插即用的知识蒸馏增强框架来耦合问题回答与理由推断过程。关键贡献是引入一个新分支,作为连接过程的桥梁。鉴于框架与模型无关,我们将其应用于现有流行基线并在基准数据集上验证有效性。如实验结果详述,当配备我们的框架时,这些基线取得一致且显著的性能提升,证明了过程耦合的可行性及所提框架的优越性。

关键词

引用

@article{arxiv.2202.12626,
  title  = {Joint Answering and Explanation for Visual Commonsense Reasoning},
  author = {Zhenyang Li and Yangyang Guo and Kejie Wang and Yinwei Wei and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2202.12626},
  year   = {2023}
}