Proprio:基于潜在自评与推理时细化的物理可信视频生成
计算机视觉与模式识别
2026-05-28 v1
摘要
现代视频生成模型虽能产生视觉上令人印象深刻的结果,却经常违反基本物理原理。我们提出Proprio,一种无训练框架,使冻结的视频生成器能够评估并改进其输出的物理可信性。灵感来自 proprioception(体感),即生物体对自身运动的感知。Proprio将模型在受控潜在扰动下的流残差作为自评信号。被生成器学习动力学更好解释的样本会产生更小且更稳定的残差。我们跨时间步和扰动聚合该信号,通过动态时空掩码将其聚焦于运动相关区域,并用于最佳N搜索、基于梯度的自我细化,或两者兼施。在文本到视频和图像到视频基准测试中,Proprio consistently improve physical plausibility,超越基于VLM的评分,在几个设置下优于外部世界模型基线。以TurboWan2.2为例,Proprio将Physics-IQ从32.2提升至37.5(+16.5%),将VideoPhy2-hard物理常识从45.6提升至55.0(+20.6%)。人类评估进一步显示,在物理可信性方面,评分者在约二分之三的比较中更倾向于选择Proprio选取或细化后的视频。这些结果表明,冻结的视频生成器包含可用于评估和改进其自身输出物理可信性的可操作内部信号。
引用
@article{arxiv.2605.28230,
title = {Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation},
author = {Mariam Hassan and Kaouther Messaoud and Wuyang Li and Alexandre Alahi},
journal= {arXiv preprint arXiv:2605.28230},
year = {2026}
}