中文

视觉常识推理的因果去偏

计算机视觉与模式识别 2025-10-24 v1 多媒体

摘要

视觉常识推理(VCR)指的是基于图像回答问题并提供解释。虽然现有方法实现了高预测精度,但它们常常忽略数据集中的偏差,并且缺乏去偏策略。在本文中,我们的分析揭示了文本和视觉数据中的共现偏差和统计偏差。我们引入了VCR-OOD数据集,包括VCR-OOD-QA和VCR-OOD-VA子集,旨在评估模型在两种模态上的泛化能力。此外,我们分析了VCR中的因果图和预测捷径,并采用后门调整方法来消除偏差。具体来说,我们基于正确答案集创建了一个字典,以消除预测捷径。实验证明了我们的去偏方法在不同数据集上的有效性。

关键词

引用

@article{arxiv.2510.20281,
  title  = {Causal Debiasing for Visual Commonsense Reasoning},
  author = {Jiayi Zou and Gengyun Jia and Bing-Kun Bao},
  journal= {arXiv preprint arXiv:2510.20281},
  year   = {2025}
}