ImageReward:文本到图像生成中人类偏好的学习与评估
计算机视觉与模式识别
2023-12-29 v4 机器学习
摘要
我们提出一套从人类偏好反馈中学习和改进文本到图像模型的综合方案。首先,我们构建ImageReward——首个通用文本到图像人类偏好奖励模型——以有效编码人类偏好。其训练基于我们系统的包含评分与排序的标注流程,迄今已收集137k专家比较。在人类评估中,ImageReward优于现有打分模型和指标,使其成为评估文本到图像合成的有前景的自动指标。在此基础上,我们提出奖励反馈学习(ReFL),一种针对打分器优化扩散模型的直接调优算法。自动和人工评估均支持ReFL相较对比方法的优势。所有代码和数据集见 \url{https://github.com/THUDM/ImageReward}。
引用
@article{arxiv.2304.05977,
title = {ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation},
author = {Jiazheng Xu and Xiao Liu and Yuchen Wu and Yuxuan Tong and Qinkai Li and Ming Ding and Jie Tang and Yuxiao Dong},
journal= {arXiv preprint arXiv:2304.05977},
year = {2023}
}
备注
32 pages