中文

Pick-a-Pic:一个开放的用户文本到图像生成偏好数据集

计算机视觉与模式识别 2023-11-27 v2 人工智能

摘要

从文本到图像的用户处收集大规模人类偏好数据集的能力通常仅限于公司,使得此类数据集无法为公众所获取。为解决此问题,我们创建了一个网络应用,使文本到图像用户能够生成图像并指定其偏好。利用该网络应用,我们构建了 Pick-a-Pic,一个大规模的、开放的文本到图像提示词及真实用户对生成图像的偏好的数据集。我们利用该数据集训练了一个基于 CLIP 的评分函数 PickScore,其在预测人类偏好的任务上表现出超越人类的表现。随后,我们测试了 PickScore 执行模型评估的能力,并观察到它比其他自动评估指标更好地与人类排序相关。因此,我们推荐使用 PickScore 来评估未来的文本到图像生成模型,并使用 Pick-a-Pic 提示词作为比 MS-COCO 更相关的数据集。最后,我们展示了 PickScore 如何通过排序增强现有的文本到图像模型。

关键词

引用

@article{arxiv.2305.01569,
  title  = {Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation},
  author = {Yuval Kirstain and Adam Polyak and Uriel Singer and Shahbuland Matiana and Joe Penna and Omer Levy},
  journal= {arXiv preprint arXiv:2305.01569},
  year   = {2023}
}