LLMScore:揭示大语言模型在文生图合成评估中的能力
计算机视觉与模式识别
2023-05-19 v1 计算与语言
摘要
现有的文生图合成自动评估只能提供图文匹配分数,未考虑对象级组合性,导致与人工判断相关性差。在这项工作中,我们提出 LLMScore,一种提供多粒度组合性评估分数的新框架。LLMScore 利用大语言模型(LLMs)来评估文生图模型。首先,它将图像转换为图像级和对象级的视觉描述。然后将评估指令输入 LLMs 以衡量合成图像与文本的对齐程度,最终生成附带理由的分数。我们的大量分析表明,在广泛的数据集(Attribute Binding Contrast、Concept Conjunction、MSCOCO、DrawBench、PaintSkills)上,LLMScore 与人工判断的相关性最高。值得注意的是,我们的 LLMScore 与人工评价的 Kendall's tau 相关性分别比常用的图文匹配指标 CLIP 和 BLIP 高 58.8% 和 31.2%。
引用
@article{arxiv.2305.11116,
title = {LLMScore: Unveiling the Power of Large Language Models in Text-to-Image Synthesis Evaluation},
author = {Yujie Lu and Xianjun Yang and Xiujun Li and Xin Eric Wang and William Yang Wang},
journal= {arXiv preprint arXiv:2305.11116},
year = {2023}
}