MVReward:更好地对齐和评估多视角扩散模型与人类偏好
计算机视觉与模式识别
2024-12-10 v1
摘要
近年来,3D内容生成取得了显著进展。然而,相应的评估方法难以跟上步伐。自动方法已被证明难以与人类偏好对齐,而文本驱动和图像驱动方法的混合比较往往导致不公平的评估。在本文中,我们提出了一个全面的框架,以更好地对齐和评估多视角扩散模型与人类偏好。首先,我们从DALL·E和Objaverse中收集并筛选了一套标准化的图像提示集,然后用它通过多种多视角扩散模型生成多视角资产。通过对这些资产的系统性排序流程,我们获得了包含16k专家配对比较的人类标注数据集,并训练了一个奖励模型,即MVReward,以有效编码人类偏好。有了MVReward,图像驱动的3D方法可以在更公平和透明的方式下相互比较。在此基础上,我们进一步提出了多视角偏好学习(MVP),一种即插即用的多视角扩散调优策略。大量实验表明,MVReward可以作为可靠的评估指标,MVP持续增强多视角扩散模型与人类偏好的对齐。
引用
@article{arxiv.2412.06614,
title = {MVReward: Better Aligning and Evaluating Multi-View Diffusion Models with Human Preferences},
author = {Weitao Wang and Haoran Xu and Yuxiao Yang and Zhifang Liu and Jun Meng and Haoqian Wang},
journal= {arXiv preprint arXiv:2412.06614},
year = {2024}
}