RDPO:面向物理一致性视频生成的真实数据偏好优化
计算机视觉与模式识别
2025-06-24 v1
摘要
视频生成技术在视觉质量方面取得了显著进展,但忠实地再现真实世界的物理规律仍然难以实现。基于偏好的模型后训练可以改善物理一致性,但需要昂贵的人工标注数据集或尚不可行的奖励模型。为应对这些挑战,我们提出了真实数据偏好优化(RDPO),这是一个无需标注的框架,可直接从真实视频中提炼物理先验知识。具体而言,所提出的RDPO利用预训练生成器对真实视频序列进行反向采样,自动构建在物理正确性方面具有统计可区分性的偏好对。随后,一个多阶段迭代训练方案引导生成器越来越准确地遵循物理定律。得益于从真实视频中挖掘的动态信息,我们提出的RDPO显著提升了生成视频的动作连贯性和物理真实感。在多个基准测试和人工评估上的结果表明,RDPO在多个维度上均取得了改进。本文的源代码和演示可在 https://wwenxu.github.io/RDPO/ 获取。
引用
@article{arxiv.2506.18655,
title = {RDPO: Real Data Preference Optimization for Physics Consistency Video Generation},
author = {Wenxu Qian and Chaoyue Wang and Hou Peng and Zhiyu Tan and Hao Li and Anxiang Zeng},
journal= {arXiv preprint arXiv:2506.18655},
year = {2025}
}
备注
16 pages, 10 figures