中文

YoCausal:视频生成离世界模型有多远?一种因果学视角

计算机视觉与模式识别 2026-05-29 v1

摘要

随着视频扩散模型(VDMs)向世界模型发展,一个关键问题浮现:它们是否真正理解因果,抑或仅过拟合于统计时序模式?现有基准大多依赖合成数据,由于仿真到现实的鸿沟,限制了其在真实场景中的泛化。我们提出YoCausal,一种受认知科学中“期望违反(Violation of Expectation, VoE)”范式启发的两级基准测试。通过以零成本在真实世界视频上进行时序反转生成自然反事实样本,YoCausal 建立了一个可任意扩展的评估协议。第 1 级引入逆向惊讶指数(Reverse Surprise Index, RSI),量化时间之箭的感知;第 2 级引入因果认知指数(Causality Cognition Index, CCI),利用视觉语言模型将数据集划分为因果与非因果子集,从而分离真实的因果推理与时序偏见。对 13 种最先进 VDMs 的评估显示,感知时间之箭并不等同于理解因果,与人类水平的因果认知之间仍存在显著差距。

关键词

引用

@article{arxiv.2605.30346,
  title  = {YoCausal: How Far is Video Generation from World Model? A Causality Perspective},
  author = {You-Zhe Xie and Yu-Hsuan Li and Jie-Ying Lee and Kaipeng Zhang and Yu-Lun Liu and Zhixiang Wang},
  journal= {arXiv preprint arXiv:2605.30346},
  year   = {2026}
}

备注

Project page: https://www.youzhexie.me/papers/YoCausal/index.html