PhyCo:学习可控物理先验以生成运动
计算机视觉与模式识别
2026-05-01 v1 人工智能
机器学习
摘要
现代视频扩散模型擅长外观合成,但在物理一致性方面仍有困难:物体漂移,碰撞缺乏真实的反弹,材料响应很少与其底层属性匹配。我们提出了PhyCo,这是一个将连续、可解释且基于物理的控制引入视频生成的框架。我们的方法集成了三个关键组件:(i) 一个包含超过10万个逼真模拟视频的大规模数据集,其中摩擦、恢复系数、形变和力在不同的场景中系统地变化;(ii) 使用以像素对齐的物理属性图为条件的ControlNet,对预训练扩散模型进行物理监督微调;(iii) VLM引导的奖励优化,其中微调后的视觉语言模型通过有针对性的物理查询评估生成的视频,并提供可微分的反馈。这种组合使得生成模型能够通过物理属性的变化产生物理一致且可控的输出——在推理时无需任何模拟器或几何重建。在Physics-IQ基准测试中,PhyCo显著提高了物理真实感,超越了强大的基线模型,并且人类研究证实了对物理属性更清晰、更忠实的控制。我们的结果展示了一条通向物理一致、可控的生成式视频模型的可扩展路径,该模型能够泛化到合成训练环境之外。
引用
@article{arxiv.2604.28169,
title = {PhyCo: Learning Controllable Physical Priors for Generative Motion},
author = {Sriram Narayanan and Ziyu Jiang and Srinivasa Narasimhan and Manmohan Chandraker},
journal= {arXiv preprint arXiv:2604.28169},
year = {2026}
}
备注
CVPR 2026. Project Page: https://phyco-video.github.io/