中文

RealDPO:真实还是不真实,这就是偏好

计算机视觉与模式识别 2025-11-07 v2 人工智能

摘要

视频生成模型近期在合成质量方面取得了显著进展。然而,生成复杂运动仍是关键挑战,因为现有模型常难以产生自然、平滑且上下文一致的运动。生成运动与真实世界运动之间的差距限制了其实际应用价值。为此,我们提出RealDPO,这是一种新颖的对齐范式,利用真实数据作为正样本进行偏好学习,从而实现更精准的运动合成。不同于传统监督微调(SFT)仅提供有限纠错反馈,RealDPO采用定制化损失函数的直接偏好优化(DPO),以增强运动真实性。通过对比真实视频与错误模型输出,RealDPO实现迭代自我纠正,逐步细化运动质量。为支持复杂运动合成的后训练,我们提出RealAction-5K,一个包含高质量视频的数据集,捕捉人类日常活动,具有丰富且精确的运动细节。大量实验表明,RealDPO在视频质量、文本对齐和运动真实性方面均显著优于最先进模型和现有偏好优化技术。

关键词

引用

@article{arxiv.2510.14955,
  title  = {RealDPO: Real or Not Real, that is the Preference},
  author = {Guo Cheng and Danni Yang and Ziqi Huang and Jianlou Si and Chenyang Si and Ziwei Liu},
  journal= {arXiv preprint arXiv:2510.14955},
  year   = {2025}
}

备注

Code:https://github.com/Vchitect/RealDPO Project Page:https://vchitect.github.io/RealDPO-Project/