PhysMaster:基于强化学习掌握物理表示以提升视频生成的物理感知能力
计算机视觉与模式识别
2025-10-16 v1
摘要
当前视频生成模型能够生成视觉上逼真的视频,但往往难以遵循物理规律,限制了其生成物理上合理视频和作为“世界模型”的能力。为此,我们提出 PhysMaster,通过捕捉物理知识的表示来指导视频生成模型增强其物理感知能力。具体而言,PhysMaster 基于图像到视频任务,其中模型需从输入图像预测物理上合理的动态。由于输入图像提供了场景中物体相对位置和潜在相互作用的物理先验,我们设计 PhysEncoder 从图像中编码物理信息作为额外条件,将物理知识注入视频生成过程。由于模型仅凭外观表现缺乏对物理性能的适当监督,导致 PhysEncoder 采用强化学习来进行物理表示学习,这通过直接偏好优化(DPO)利用生成模型的反馈以端到端方式优化物理表示。PhysMaster 为提高 PhysEncoder 及视频生成的物理感知能力提供了可行方案,证明其在简单代理任务和广泛物理情景上的通用性。这意味着我们的 PhysMaster 能够通过强化学习范式中的表示学习统一解决各种物理过程,充当物理感知视频生成及更广泛应用的通用插件式解决方案。
引用
@article{arxiv.2510.13809,
title = {PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning},
author = {Sihui Ji and Xi Chen and Xin Tao and Pengfei Wan and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2510.13809},
year = {2025}
}
备注
Project Page: https://sihuiji.github.io/PhysMaster-Page/