DreamReward:基于人类偏好的文本到3D生成
计算机视觉与模式识别
2024-03-22 v1 计算与语言
机器学习
摘要
近年来,基于文本提示的3D内容创作已取得显著成功。然而,当前的文本到3D方法生成的3D结果往往与人类偏好不能很好地对齐。在本文中,我们提出了一个综合框架,称为DreamReward,以从人类偏好反馈中学习并改进文本到3D模型。首先,我们基于包含评分和排序的系统化标注流程,收集了25k个专家比较数据。然后,我们构建了Reward3D——首个通用型文本到3D人类偏好奖励模型,以有效地编码人类偏好。在3D奖励模型的基础上,我们最终进行了理论分析,并提出了Reward3D反馈学习(DreamFL),这是一种通过重新定义的评分器来优化多视角扩散模型的直接调优算法。基于理论证明和广泛的实验比较,我们的DreamReward成功生成了高保真且3D一致的结果,并在与人类意图的提示对齐方面有显著提升。我们的结果展示了从人类反馈中学习以改进文本到3D模型的巨大潜力。
引用
@article{arxiv.2403.14613,
title = {DreamReward: Text-to-3D Generation with Human Preference},
author = {Junliang Ye and Fangfu Liu and Qixiu Li and Zhengyi Wang and Yikai Wang and Xinzhou Wang and Yueqi Duan and Jun Zhu},
journal= {arXiv preprint arXiv:2403.14613},
year = {2024}
}
备注
Project page: https://jamesyjl.github.io/DreamReward