中文

人类偏好分数:更好地使文本到图像模型与人类偏好对齐

计算机视觉与模式识别 2023-08-23 v2 人工智能

摘要

近年来深度生成模型快速增长,其中文本到图像模型受到公众显著关注。然而,现有模型生成的图像往往不能很好地与人类偏好对齐,例如肢体和面部表情的尴尬组合。为解决此问题,我们从Stable Foundation Discord频道收集了关于生成图像的人类选择数据集。我们的实验表明,现有的生成模型评价指标与人类选择相关性不佳。因此,我们利用收集的数据集训练了一个人类偏好分类器,并基于该分类器推导出人类偏好分数(HPS)。利用HPS,我们提出了一种简单而有效的方法来调整Stable Diffusion以更好地与人类偏好对齐。我们的实验显示,HPS在预测人类选择方面优于CLIP,并对其他模型生成的图像具有良好的泛化能力。通过在HPS引导下微调Stable Diffusion,调整后的模型能够生成更受人类用户偏好的图像。项目页面见:https://tgxs002.github.io/align_sd_web/ 。

关键词

引用

@article{arxiv.2303.14420,
  title  = {Human Preference Score: Better Aligning Text-to-Image Models with Human Preference},
  author = {Xiaoshi Wu and Keqiang Sun and Feng Zhu and Rui Zhao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2303.14420},
  year   = {2023}
}

备注

Accepted by ICCV 2023