HuViDPO:通过直接偏好优化增强以人为中心的视频生成对齐
计算机视觉与模式识别
2025-02-05 v1
摘要
随着AIGC技术的快速发展,基于扩散模型的文本到图像(T2I)和文本到视频(T2V)技术取得了显著进展。近年来,少数研究将直接偏好优化(DPO)策略引入T2I任务,显著提升了生成图像中的人类偏好。然而,现有的T2V生成方法缺乏一个结构良好的流程和精确的损失函数,来利用DPO策略引导生成视频与人类偏好对齐。此外,配对视频偏好数据的稀缺等挑战阻碍了有效的模型训练。同时,训练数据集的缺乏也带来了生成视频灵活性不足和视频生成质量差的风险。基于这些问题,我们的工作依次提出了三个针对性解决方案。1)我们的工作首次将DPO策略引入T2V任务。通过推导一个精心构建的损失函数,我们利用人类反馈使视频生成与人类偏好对齐。我们将此新方法称为HuViDPO。2)我们的工作为每个动作类别构建了小规模的人类偏好数据集,并对该模型进行微调,在降低训练成本的同时提高了生成视频的美学质量。3)我们采用首帧条件策略,利用首帧的丰富信息来指导后续帧的生成,增强了视频生成的灵活性。同时,我们采用稀疏因果注意力机制来提升生成视频的质量。更多细节和示例可访问我们的网站:https://tankowa.github.io/HuViDPO.github.io/。
引用
@article{arxiv.2502.01690,
title = {HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment},
author = {Lifan Jiang and Boxi Wu and Jiahui Zhang and Xiaotong Guan and Shuang Chen},
journal= {arXiv preprint arXiv:2502.01690},
year = {2025}
}