大规模视觉偏好优化:ViPO
计算机视觉与模式识别
2026-04-30 v2 人工智能
摘要
虽然偏好优化对改进视觉生成模型至关重要,但如何有效地将这一范式进行规模化仍然鲜有探索。当前开源偏好数据集包含冲突的偏好模式,其中获胜者在某些维度上表现出色但在其他维度上表现不足。对此类噪声数据集进行单纯优化无法学习到有效的偏好,阻碍了有效的规模化。为提高对噪声的鲁棒性,我们提出 Poly-DPO,将 DPO 目标函数扩展为包含动态调整模型置信度的多项式项,使其能够在多样化的数据分布上实现有效学习。除了偏差模式之外,现有数据集还受限于分辨率偏低、提示样本性不足以及分布不平衡。为促进大规模视觉偏好优化,我们构建了 ViPO,一个包含 1024 像素下 100 万张图像对(跨五个类别)和 720p+ 30 万段视频对(跨三个类别)的大规模偏好数据集。领先的生成模型和多样化的提示确保了可靠的偏好信号并实现分布平衡。令人惊讶的是,将 Poly-DPO 应用于高质量数据集后,最佳配置收敛到标准 DPO。这种收敛验证了数据集质量和 Poly-DPO 的自适应性:在数据质量足够时,无需复杂的优化,但对于不完美的数据集仍然有价值。我们在视觉生成模型上验证了该方法。在分辨率较低的数据集如 Pick-a-Pic V2 上,Poly-DPO 在 SD1.5 和 SDXL 上分别在 GenEval 上获得 6.87 和 2.32 的提升。对于 ViPO,所训练的模型性能远超在现有开源偏好数据集上训练的模型。这些结果表明,解决算法自适应性和数据质量问题是实现大规模视觉偏好优化的关键。
引用
@article{arxiv.2604.24953,
title = {ViPO: Visual Preference Optimization at Scale},
author = {Ming Li and Jie Wu and Justin Cui and Xiaojie Li and Rui Wang and Chen Chen},
journal= {arXiv preprint arXiv:2604.24953},
year = {2026}
}
备注
ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO