面向物理上可信视频生成的事件中心因果思维链
计算机视觉与模式识别
2026-03-31 v2
摘要
物理上可信视频生成(PPVG)已成为建模真实世界物理现象的有前景的途径。PPVG需要理解常识知识,这仍是视频扩散模型面临的挑战。当前方法利用大型语言模型的常识推理能力将物理概念嵌入提示词中。然而,生成模型常因缺乏建模因果递进性的条件机制,将物理现象渲染为单个由提示词定义的时刻。本文将PPVG视为生成一系列因果相连且动态演化事件的过程。为实现此范式,我们设计了两个关键模块:(1)物理驱动的事件链推理。该模块将提示词中描述的物理现象分解为多个基本事件单元,利用链式思维进行推理。为缓解因果歧义,我们将物理公式作为约束,以确定性因果依赖性来施加推理。(2)面向跨模态提示的转换感知(TCP)。该模块将因果事件单元转换为时序对齐的视觉-语言提示。它总结离散事件描述以获得因果一致的叙事,同时通过交互式编辑逐步合成各个事件的视觉关键帧。针对PhyGenBench和VideoPhy基准进行的全面实验表明,我们的框架在多样化物理领域中在生成物理上可信视频方面实现了卓越的性能。代码可在 https://github.com/ZixuanWang0525/CoECT 获取。
引用
@article{arxiv.2603.09094,
title = {Chain of Event-Centric Causal Thought for Physically Plausible Video Generation},
author = {Zixuan Wang and Yixin Hu and Haolan Wang and Feng Chen and Yan Liu and Wen Li and Yinjie Lei},
journal= {arXiv preprint arXiv:2603.09094},
year = {2026}
}
备注
Accepted by CVPR2026