中文

Human Preference Score v2:评估文本到图像合成人类偏好的可靠基准

计算机视觉与模式识别 2023-09-26 v2 人工智能 数据库

摘要

近期文本到图像生成模型可从文本输入生成高保真图像,但这些生成图像的质量无法被现有评估指标准确评价。为解决此问题,我们引入 Human Preference Dataset v2 (HPD v2),一个捕获来自广泛来源图像上人类偏好的大规模数据集。HPD v2 包含对 433,760 对图像的 798,090 个人类偏好选择,使其成为同类中最大数据集。文本提示与图像经审慎收集以消除潜在偏差,而偏差是先前数据集的普遍问题。通过在 HPD v2 上微调 CLIP,我们获得 Human Preference Score v2 (HPS v2),一种能更准确预测生成图像上人类偏好的打分模型。我们的实验表明,HPS v2 在各种图像分布上比先前指标泛化更好,且对文本到图像生成模型的算法改进具有响应性,使其成为这些模型更优的评估指标。我们还研究了文本到图像生成模型的评估提示设计,以使评估稳定、公平且易用。最后,我们利用 HPS v2 为文本到图像生成模型建立基准,涵盖来自学术界、社区与工业界的一组近期文本到图像模型。代码与数据集可在 https://github.com/tgxs002/HPSv2 获取。

关键词

引用

@article{arxiv.2306.09341,
  title  = {Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis},
  author = {Xiaoshi Wu and Yiming Hao and Keqiang Sun and Yixiong Chen and Feng Zhu and Rui Zhao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2306.09341},
  year   = {2023}
}

备注

Revision