VACT:视频自动因果测试系统与基准
人工智能
2025-04-22 v2 计算机视觉与模式识别
应用统计
摘要
随着文本条件视频生成模型(VGMs)的快速发展,生成视频的质量显著提升,使这些模型更接近于作为“世界模拟器”运行,并使现实世界级别的视频生成更易获得且更具成本效益。然而,生成的视频通常包含事实性错误,且缺乏对基本物理定律的理解。尽管此前的一些研究通过人工分析在有限领域内强调了这一问题,但目前尚未建立全面的解决方案,这主要由于缺乏一种通用、自动化的方法来建模和评估这些模型在多样场景下的因果推理。为了弥补这一空白,我们提出了 VACT:一个用于在真实世界场景中建模、评估和测量 VGMs 因果理解的自动化框架。通过将因果分析技术与精心设计的大语言模型助手相结合,我们的系统无需人工标注即可评估模型在各种上下文中的因果行为,这提供了强大的泛化能力与可扩展性。此外,我们引入了多级因果评估指标,以对 VGMs 的因果性能进行详细分析。作为演示,我们使用我们的框架对几种主流的 VGMs 进行了基准测试,深入了解了它们的因果推理能力。我们的工作为系统解决 VGMs 中的因果理解缺陷奠定了基础,并有助于提升其可靠性与真实世界适用性。
引用
@article{arxiv.2503.06163,
title = {VACT: A Video Automatic Causal Testing System and a Benchmark},
author = {Haotong Yang and Qingyuan Zheng and Yunjian Gao and Yongkun Yang and Yangbo He and Zhouchen Lin and Muhan Zhang},
journal= {arXiv preprint arXiv:2503.06163},
year = {2025}
}
备注
A preliminary version of this paper has been accepted by workshop SCSL@ICLR 2025