Dual-IPO:用于文本到视频生成的双重迭代偏好优化
计算机视觉与模式识别
2026-02-27 v5 人工智能
摘要
视频生成的最新进展使得通过可扩展的扩散变换器生成逼真视频成为可能,带来了令人兴奋的体验。然而,它们通常无法产生符合用户真实需求和偏好的满意输出。在这项工作中,我们引入了双重迭代优化 (Dual-IPO),这是一种迭代范式,它顺序优化奖励模型和视频生成模型,以提高合成质量和人类偏好对齐。对于奖励模型,我们的框架通过思维链引导的推理、基于投票的自一致性和偏好确定性估计来确保可靠且稳健的奖励信号。鉴于此,我们利用奖励模型反馈的信号来优化视频基础模型,从而提升合成质量,包括主体一致性、运动平滑度和美学质量等。奖励模型和视频生成模型相互补充,并在多轮迭代中逐步改进,无需繁琐的人工偏好标注。综合实验表明,所提出的 Dual-IPO 能够有效且持续地提高具有各种架构和规模的基础模型的视频生成质量,甚至帮助一个仅有 2B 参数的模型超越 5B 参数的模型。此外,我们的分析实验和消融研究确定了我们系统设计的合理性以及每个组件的有效性。
引用
@article{arxiv.2502.02088,
title = {Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation},
author = {Xiaomeng Yang and Mengping Yang and Jia Gong and Luozheng Qin and Zhiyu Tan and Hao Li},
journal= {arXiv preprint arXiv:2502.02088},
year = {2026}
}
备注
To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO