学习文本到图像生成中的多维人类偏好
计算机视觉与模式识别
2024-05-24 v1
摘要
当前文本到图像模型的评估指标通常依赖统计指标,无法充分代表人类的真实偏好。尽管近期工作尝试通过人工标注图像学习这些偏好,但它们将丰富的人类偏好简化为单一总体分数。然而,当人类从不同方面评估图像时,偏好结果会有所不同。因此,为了学习多维人类偏好,我们提出了多维偏好分数(MPS),这是首个用于评估文本到图像模型的多维偏好评分模型。MPS在CLIP模型上引入了偏好条件模块来学习这些多样化的偏好。它基于我们的多维人类偏好(MHP)数据集进行训练,该数据集包含607,541张图像在四个维度(即美学、语义对齐、细节质量和总体评估)上的918,315个人类偏好选择。这些图像由多种最新的文本到图像模型生成。MPS在3个数据集的4个维度上优于现有评分方法,使其成为评估和改进文本到图像生成的有前景的指标。
引用
@article{arxiv.2405.14705,
title = {Learning Multi-dimensional Human Preference for Text-to-Image Generation},
author = {Sixian Zhang and Bohan Wang and Junqiang Wu and Yan Li and Tingting Gao and Di Zhang and Zhongyuan Wang},
journal= {arXiv preprint arXiv:2405.14705},
year = {2024}
}