中文

CauSight:用于视觉因果发现的学习式超感知

计算机视觉与模式识别 2025-12-02 v1

摘要

因果思维使人类不仅能理解看到什么,更能理解为何如此。为在现代 AI 系统中复制这一能力,本文引入了视觉因果发现任务。该任务要求模型在各种场景中推断视觉实体之间的因果关系,而不仅仅是感知它们的存在。为此,我们首先构建了视觉因果图数据集(VCG-32K),该数据集包含超过 32,000 张标注了实体级因果图的图像,并进一步开发了 CauSight,一种用于通过因果感知推理进行视觉因果发现的新型视觉语言模型。我们的训练配方集成了三个组件:(1)来自 VCG-32K 的训练数据精选;(2)Tree-of-Causal-Thought(ToCT)用于合成推理轨迹;(3)使用设计的因果奖励进行强化学习以细化推理策略。实验表明,CauSight 在视觉因果发现方面的性能超过 GPT-4.1,实现了三倍以上的性能提升(21% 的绝对提升)。我们的代码、模型和数据集已完全开源于项目页面:https://github.com/OpenCausaLab/CauSight。

关键词

引用

@article{arxiv.2512.01827,
  title  = {CauSight: Learning to Supersense for Visual Causal Discovery},
  author = {Yize Zhang and Meiqi Chen and Sirui Chen and Bo Peng and Yanxi Zhang and Tianyu Li and Chaochao Lu},
  journal= {arXiv preprint arXiv:2512.01827},
  year   = {2025}
}

备注

project page: https://github.com/OpenCausaLab/CauSight