基于扩散时间步标记的物理视频生成强化学习推理
计算机视觉与模式识别
2025-04-23 v1
摘要
尽管近期在视频生成方面取得了进展,但生成遵循物理规律的视频仍是重大挑战。传统扩散方法依赖数据驱动的近似,难以外推到未见的物理条件(如速度)。为此,我们提出将符号推理与强化学习集成,以强制执行物理一致性。我们首次引入扩散时间步标记器(DDT),通过恢复扩散过程中丢失的视觉属性来学习离散、递归的视觉标记。递归视觉标记使大型语言模型能够进行符号推理。基于此,我们提出 Phys-AR 框架,包含两个阶段:第一个阶段使用监督微调传递符号知识,第二个阶段应用强化学习通过基于物理条件的奖励函数优化模型的推理能力。我们的方法允许模型动态调整和改进生成视频的物理属性,确保遵循物理规律。实验结果表明,PhysAR 能生成符合物理规律的视频。
引用
@article{arxiv.2504.15932,
title = {Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning},
author = {Wang Lin and Liyu Jia and Wentao Hu and Kaihang Pan and Zhongqi Yue and Wei Zhao and Jingyuan Chen and Fei Wu and Hanwang Zhang},
journal= {arXiv preprint arXiv:2504.15932},
year = {2025}
}