通过对不合理性的推理增强视频生成中的物理合理性
计算机视觉与模式识别
2026-04-07 v2
摘要
扩散模型能够生成逼真的视频,但现有方法依赖于从大规模文本-视频数据集中隐式学习物理推理,这不仅成本高昂、难以扩展,而且仍容易产生违反基本物理定律的不合理运动。我们引入了一个免训练框架,通过在推理时显式推理不合理性并引导生成过程远离不合理性,来提高物理合理性。具体而言,我们采用轻量级的物理感知推理管道来构建反事实提示,这些提示故意编码了违反物理的行为。然后,我们提出了一种新颖的同步解耦引导(SDG)策略,该策略通过同步方向归一化利用这些提示来抵消滞后抑制,并通过轨迹解耦去噪来减轻累积轨迹偏差,确保在整个去噪过程中不合理内容得到立即且一致的抑制。跨不同物理域的实验表明,尽管不需要额外训练,我们的方法在保持照片级真实感的同时,显著增强了物理保真度。消融研究证实了物理感知推理组件和 SDG 的互补有效性。特别是,上述 SDG 的两项设计也得到了单独验证,它们对不合理内容的抑制和物理合理性的整体增益做出了关键贡献。这为视频生成建立了一种新颖且即插即用的物理感知范式。
引用
@article{arxiv.2509.24702,
title = {Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility},
author = {Yutong Hao and Chen Chen and Ajmal Saeed Mian and Chang Xu and Daochang Liu},
journal= {arXiv preprint arXiv:2509.24702},
year = {2026}
}