中文

VisionReward:面向图像和视频生成的细粒度多维人类偏好学习框架

计算机视觉与模式识别 2026-01-06 v4

摘要

视觉生成模型在合成逼真的图像和视频方面取得了显著进展,但跨关键维度与人类偏好保持一致仍是持续的挑战。虽然从人类反馈获得强化学习在偏好对齐方面前景光明,但现有的视觉生成奖励模型面临诸多限制,包括缺乏可解释性的评分以及潜在导致意外偏差的问题。我们提出 VisionReward,一个用于学习人类视觉偏好的通用框架,适用于图像和视频生成。具体而言,我们采用分层视觉评估框架捕获细粒度人类偏好,利用线性加权实现可解释的偏好学习。此外,我们提出一种在使用 VisionReward 作为视觉生成偏好优化的奖励模型时的多维一致性策略。实验表明,VisionReward 在机器指标和人类评估方面显著优于现有图像和视频奖励模型。值得注意的是,使用 VisionReward 的文本到视频模型在偏好预测准确率上比使用 VideoScore 提高了 17.2%,而相同模型使用 VisionReward 实现的文本到视频模型在双向获胜率上提升了 31.6%。所有代码和数据集均提供于 https://github.com/THUDM/VisionReward。

关键词

引用

@article{arxiv.2412.21059,
  title  = {VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation},
  author = {Jiazheng Xu and Yu Huang and Jiale Cheng and Yuanming Yang and Jiajun Xu and Yuan Wang and Wenbo Duan and Shen Yang and Qunlin Jin and Shurun Li and Jiayan Teng and Zhuoyi Yang and Wendi Zheng and Xiao Liu and Dan Zhang and Ming Ding and Xiaohan Zhang and Xiaotao Gu and Shiyu Huang and Minlie Huang and Jie Tang and Yuxiao Dong},
  journal= {arXiv preprint arXiv:2412.21059},
  year   = {2026}
}

备注

27 pages