中文

通过两层认知的因果推理提升视觉问答的泛化能力

人工智能 2023-10-10 v1

摘要

视觉问答(VQA)中的泛化要求模型回答关于训练分布之外语境的图像问题。现有尝试主要精炼单模态方面,忽视了多模态方面的增强。此外,对输入的不同解释导致多种答案生成模式,凸显了 VQA 中解释与回答步骤间因果推理的作用。基于此视角,我们提出认知路径 VQA(CopVQA),通过强调因果推理因素来改善多模态预测。CopVQA 首先运行一组路径池,捕获贯穿解释与回答阶段的多样因果推理流。类比人类认知,我们将每阶段职责分解为不同专家与一个认知使能组件(CC)。两个 CC 策略性地每次为每个阶段执行一个专家。最后,我们优先选择涉及两个 CC 的路径所主导的答案预测,同时忽略仅由任一 CC 产生的答案,从而强调因果推理并支持泛化。我们在真实生活与医疗数据上的实验一致验证了 CopVQA 在基线与跨域上提升 VQA 性能与泛化。值得注意的是,CopVQA 在 PathVQA 数据集上达到新的最先进(SOTA),并在 VQA-CPv2、VQAv2 与 VQA RAD 上取得与当前 SOTA 相当的准确性,而模型规模为四分之一。

关键词

引用

@article{arxiv.2310.05410,
  title  = {Causal Reasoning through Two Layers of Cognition for Improving Generalization in Visual Question Answering},
  author = {Trang Nguyen and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2310.05410},
  year   = {2023}
}