什么构成了一张好的生成图像?探究人类与多模态 LLM 的图像偏好对齐
计算机视觉与模式识别
2025-09-17 v1
摘要
生成式文本到图像模型的自动化评估仍然是一个具有挑战性的问题。近期的研究提出使用多模态 LLM 来评判图像质量,但这些研究对于多模态 LLM 如何利用与人类相关的概念(如图像风格或构图)来生成其总体评估,提供的见解甚少。在这项工作中,我们研究了图像的哪些属性——特别是美学、无伪影、解剖准确性、构图正确性、对象一致性和风格——对于 LLM 和人类做出图像质量判断是重要的。我们首先使用合成生成的图像对整理了一个人类偏好数据集。我们利用每对图像质量属性之间的任务间相关性来理解哪些属性在人类判断中是相关的。对 LLM 重复相同的分析后,我们发现图像质量属性之间的关系要弱得多。最后,我们通过生成对每个维度具有高度控制的合成数据集来研究单个图像质量属性。人类能够轻松地针对所有特定的图像质量属性(例如高美学图像与低美学图像)判断图像质量,然而我们发现某些属性(如解剖准确性)对于多模态 LLM 来说要学会判断则困难得多。综上所述,这些发现揭示了人类与多模态 LLM 在感知图像方面的有趣差异。
引用
@article{arxiv.2509.12750,
title = {What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment},
author = {Rishab Parthasarathy and Jasmine Collins and Cory Stephenson},
journal= {arXiv preprint arXiv:2509.12750},
year = {2025}
}
备注
7 pages, 9 figures, 3 tables; appendix 16 pages, 9 figures, 6 tables