中文

CAUSAL3D:面向视觉数据的因果学习综合基准

计算机视觉与模式识别 2025-10-31 v3 机器学习

摘要

真正的智能取决于发现和利用隐藏因果关系的能力。尽管人工智能和计算机视觉(CV)取得了重大进展,但仍缺乏用于评估模型从复杂视觉数据中推断潜在因果关系能力的基准。在本文中,我们引入了 Causal3D,一个新颖的综合基准,将结构化数据(表格)与相应的视觉表示(图像)相结合,以评估因果推理。Causal3D 在一个系统框架内设计,由 19 个三维场景数据集组成,捕捉了多样化的因果关系、视角和背景,使得在不同复杂度的场景中进行评估成为可能。我们评估了多种最先进的方法,包括经典的因果发现、因果表征学习以及大型/视觉语言模型(LLMs/VLMs)。我们的实验表明,随着因果结构在没有先验知识的情况下变得更加复杂,性能显著下降,这凸显了即使是先进方法在复杂因果场景中也面临的挑战。Causal3D 为推进计算机视觉中的因果推理以及在关键领域培养可信赖的人工智能提供了重要资源。

关键词

引用

@article{arxiv.2503.04852,
  title  = {CAUSAL3D: A Comprehensive Benchmark for Causal Learning from Visual Data},
  author = {Disheng Liu and Yiran Qiao and Wuche Liu and Yiren Lu and Yunlai Zhou and Tuo Liang and Yu Yin and Jing Ma},
  journal= {arXiv preprint arXiv:2503.04852},
  year   = {2025}
}

备注

Datasets link: https://huggingface.co/datasets/LLDDSS/Causal3D_Dataset