迈向视频生成中的物理理解:一种三维点正则化方法
计算机视觉与模式识别
2025-10-24 v2
摘要
我们提出了一种新颖的视频生成框架,该框架融合了三维几何与动态感知。为实现这一点,我们用三维点轨迹增强二维视频,并在像素空间中对齐它们。由此产生的三维感知视频数据集 PointVid 随后被用于微调一个潜在扩散模型,使其能够用三维笛卡尔坐标跟踪二维物体。在此基础上,我们对视频中物体的形状和运动进行正则化,以消除不期望的伪影,例如非物理形变。因此,我们提高了生成 RGB 视频的质量,并缓解了诸如物体变形等常见问题,这些问题由于缺乏形状感知而在当前的视频模型中普遍存在。借助我们的三维增强和正则化方法,我们的模型能够处理接触丰富的场景,例如面向任务的视频,其中三维信息对于感知相互作用固体的形状和运动至关重要。我们的方法可以无缝集成到现有的视频扩散模型中,以提高其视觉合理性。
引用
@article{arxiv.2502.03639,
title = {Towards Physical Understanding in Video Generation: A 3D Point Regularization Approach},
author = {Yunuo Chen and Junli Cao and Vidit Goel and Sergei Korolev and Chenfanfu Jiang and Jian Ren and Sergey Tulyakov and Anil Kag},
journal= {arXiv preprint arXiv:2502.03639},
year = {2025}
}
备注
Project Page: \url{https://snap-research.github.io/PointVidGen/}