PhyGDPO:面向物理一致性的文本到视频生成的物理感知群组直接偏好优化
计算机视觉与模式识别
2026-03-06 v3
摘要
最近的文本到视频(T2V)生成技术在视觉质量方面取得了良好进展,但仍面临着合成视频无法忠实遵循物理规律的挑战。现有方法主要基于图形学或提示扩展,难以泛化到简单仿真环境之外,或学习隐式物理推理。缺乏富有物理互动和现象的训练数据的稀缺性也是一个问题。本文首先引入了物理增强视频数据构建管道(PhyAugPipe),利用带链式思维推理的视觉语言模型(VLM)收集大规模训练数据集PhyVidGen-135K。随后我们提出面向物理一致性的群组直接偏好优化(PhyGDPO)框架,利用真实视频作为胜者案例确保正确的物理学习,并基于群组Plackett-Luce概率模型捕获超越成对比较的整体偏好。在PhyGDPO中,我们设计了物理引导奖励(PGR)方案,利用VLM基于物理的奖励引导优化聚焦于具有挑战性的物理案例。此外,我们提出了LoRA开关参考(LoRA-SR)方案,避免完整模型复制以实现高效DPO训练。实验表明,我们的方法在PhyGenBench和VideoPhy2上显著优于最先进的开源方法。请访问我们的项目页面https://caiyuanhao1998.github.io/project/PhyGDPO获取更多视频结果。我们的代码、模型和数据将在https://github.com/caiyuanhao1998/Open-PhyGDPO发布。
引用
@article{arxiv.2512.24551,
title = {PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation},
author = {Yuanhao Cai and Kunpeng Li and Menglin Jia and Jialiang Wang and Junzhe Sun and Feng Liang and Weifeng Chen and Felix Juefei-Xu and Chu Wang and Ali Thabet and Xiaoliang Dai and Xuan Ju and Alan Yuille and Ji Hou},
journal= {arXiv preprint arXiv:2512.24551},
year = {2026}
}