PhysVid:面向生成式视频模型的物理感知局部条件化
计算机视觉与模式识别
2026-03-31 v2 人工智能
摘要
生成式视频模型实现了高视觉保真度,但常常违背基本物理原理,限制了其在真实场景中的可靠性。先前的物理注入尝试依赖于条件化:帧级信号具有领域特异性和短时域特性,而全局文本提示则粗糙且噪声大,遗漏了细粒度动力学。我们提出了PhysVid,一种在时间连续帧块上操作的物理感知局部条件化方案。每个帧块被标注了物理基础的态、相互作用和约束描述,这些描述通过块感知交叉注意力与全局提示在训练过程中融合。在推理阶段,我们引入负物理提示(描述局部相关的物理定律违反)以引导生成远离不合理的轨迹。在VideoPhy数据集上,PhysVid将物理常识评分相比基线视频生成器提升了约33%,在VideoPhy2上提升了约8%。这些结果表明,局部物理感知指导显著提高了生成视频的物理合理性,标志着向物理基础的视频模型迈出了重要一步。
引用
@article{arxiv.2603.26285,
title = {PhysVid: Physics Aware Local Conditioning for Generative Video Models},
author = {Saurabh Pathak and Elahe Arani and Mykola Pechenizkiy and Bahram Zonooz},
journal= {arXiv preprint arXiv:2603.26285},
year = {2026}
}
备注
Accepted for publication in CVPR 2026