视频扩散的判别器-free 直接偏好优化
计算机视觉与模式识别
2025-04-14 v1
摘要
直接偏好优化(Direct Preference Optimization, DPO)通过胜负数据对将模型与人类偏好对齐,已在语言和图像生成中取得显著成功。然而,将 DPO 应用于视频扩散模型面临关键挑战:(1)数据效率低。每次 DPO 迭代生成数千个视频代价高昂;(2)评估不确定性。人类标注受主观偏见影响,自动判别器无法检测到细微的时序瑕疵,如闪烁或运动不一致。为此,我们提出了判别器-free 视频 DPO 框架:(1)使用原始真实视频作为胜利案例,其编辑版本(如反转、混乱或噪声损坏的片段)作为失败案例;(2)训练视频扩散模型以区分和避免由编辑引入的瑕疵。该方法消除了对昂贵合成视频比较的需求,提供明确无歧义的质量信号,并通过简单的编辑操作实现无限训练数据扩展。我们理论上证明,即使真实视频与模型生成的视频遵循不同分布,框架也有效。在 CogVideoX 上的实验表明,所提方法有效。
引用
@article{arxiv.2504.08542,
title = {Discriminator-Free Direct Preference Optimization for Video Diffusion},
author = {Haoran Cheng and Qide Dong and Liang Peng and Zhizhou Sha and Weiguo Feng and Jinghui Xie and Zhao Song and Shilei Wen and Xiaofei He and Boxi Wu},
journal= {arXiv preprint arXiv:2504.08542},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2412.14167 by other authors