基于问题-答案的文本到图像生成图像幻觉评估
计算机视觉与模式识别
2025-02-11 v7 人工智能
摘要
尽管文本到图像(TTI)生成模型取得了令人印象深刻的成功,但现有研究忽略了这些模型是否准确传达事实信息的问题。本文聚焦于图像幻觉问题,即由生成模型创建的图像未能忠实描绘事实内容。为此,我们引入了 I-HallA(Image Hallucination evaluation with Question Answering),一种新型自动化评估指标,通过视觉问题解答(VQA)衡量生成图像的事实性。我们还引入了 I-HallA v1.0,一个为此 purpose 而构建的精选基准数据集。作为这一过程的一部分,我们开发了一个管道,使用多个基于 GPT-4 Omni 的智能体生成高质量的问题-答案对,并通过人类判断确保准确性。我们的评估协议通过测试现有 TTI 模型是否能正确回答这些问题来衡量图像幻觉。I-HallA v1.0 数据集包含来自九个类别的 1.2K 个多样化图像-文本对,涵盖 1,000 个严格精选的问题,涉及各种组成挑战。我们使用 I-HallA 评估了五个 TTI 模型,发现这些最先进的模型常常未能准确传达事实信息。此外,我们通过显示与人类判断之间强大的 Spearman 相关性(=0.95)来验证了该指标的可靠性。我们相信我们的基准数据集和指标可以为开发事实上准确的 TTI 生成模型提供基础。附加资源可在我们的项目页面上找到:https://sgt-lim.github.io/I-HallA/。
引用
@article{arxiv.2409.12784,
title = {Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering},
author = {Youngsun Lim and Hojun Choi and Hyunjung Shim},
journal= {arXiv preprint arXiv:2409.12784},
year = {2025}
}
备注
20 pages