基于似然的文本到图像评估:具有块级感知与语义信用分配
计算机视觉与模式识别
2023-08-17 v1
摘要
文本到图像合成近期取得了令人鼓舞的进展并吸引了大量公众关注。然而,该领域流行的评估指标,如 Inception Score 与 Fréchet Inception Distance,存在若干问题。首先,它们无法显式评估生成图像的感知质量,且难以反映每个文本-图像对的语义对齐。此外,它们效率低下,需要采样数千张图像才能使评估结果稳定。本文中,我们提出通过利用预训练的基于似然的文本到图像生成模型直接估计生成图像的似然来评估文本到图像生成性能,即更高的似然表示更好的感知质量与更好的文本-图像对齐。为防止似然被生成图像中非关键部分主导,我们提出若干新设计,基于图像块的语义与感知重要性开发信用分配策略。在实验中,我们在多个流行文本到图像生成模型与数据集上评估所提指标,考察感知质量与文本-图像对齐。而且,它仅需少至一百个样本即可成功评估这些模型的生成能力,使其在实践中非常高效。
引用
@article{arxiv.2308.08525,
title = {Likelihood-Based Text-to-Image Evaluation with Patch-Level Perceptual and Semantic Credit Assignment},
author = {Qi Chen and Chaorui Deng and Zixiong Huang and Bowen Zhang and Mingkui Tan and Qi Wu},
journal= {arXiv preprint arXiv:2308.08525},
year = {2023}
}