基于视觉问答的文本到图像生成评估指标
计算机视觉与模式识别
2024-11-18 v1
摘要
文本到图像生成和文本引导的图像操纵在图像生成任务领域受到广泛关注。然而,主流评估方法难以评估输入文本中的所有信息是否准确反映在生成的图像中,主要关注输入文本与生成图像的整体对齐。本文提出了新的评估指标,针对每个单独目标评估输入文本与生成图像的对齐。首先,根据输入文本,利用chatGPT为生成的图像生成问题。随后,使用视觉问答(VQA)测量生成图像与输入文本的相关性,相比现有方法实现了更细致的对齐评估。此外,采用非参考图像质量评估(NR-IQA)不仅评估文本-图像对齐,还评估生成图像的质量。实验结果表明,我们提出的评估方法是一种优越的指标,能同时评估更细粒度的文本-图像对齐和图像质量,并允许调整这两者的比例。
引用
@article{arxiv.2411.10183,
title = {Visual question answering based evaluation metrics for text-to-image generation},
author = {Mizuki Miyamoto and Ryugo Morita and Jinjia Zhou},
journal= {arXiv preprint arXiv:2411.10183},
year = {2024}
}
备注
Accepted to ISCAS2024