中文

VLEU:用于评估文本到图像模型通用性的自动方法

计算机视觉与模式识别 2024-11-18 v2 人工智能 计算与语言

摘要

文本到图像(Text-to-Image, T2I)模型的进展显著提升了从文本描述生成图像的能力。然而,现有的评估指标不足以充分评估模型处理多样化文本提示的能力,这对于其通用性至关重要。为此,我们引入了新的度量标准,即视觉语言评估随访(Visual Language Evaluation Understudy, VLEU)。VLEU 使用大型语言模型从视觉文本域中抽样——即T2I模型所有可能输入文本的集合——以生成各种各样的提示。从这些提示生成的图像根据其与输入文本的对齐程度使用 CLIP 模型进行评估。VLEU 通过计算视觉文本边际分布与由模型生成的图像条件分布之间的库克-莱布尔散度(Kullback-Leibler divergence)来量化模型的通用性。该度量标准提供了一种定量方法,用于比较不同的T2I模型并在模型微调期间跟踪改进。我们的实验表明,VLEU 在评估各种T2I模型的泛化能力方面有效地位,将其置于文本到图像合成未来研究的必需工具之列。

关键词

引用

@article{arxiv.2409.14704,
  title  = {VLEU: a Method for Automatic Evaluation for Generalizability of Text-to-Image Models},
  author = {Jingtao Cao and Zheng Zhang and Hongru Wang and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2409.14704},
  year   = {2024}
}

备注

accepted by EMNLP2024(long paper,main conference)