图像再生:通过多模态大语言模型生成相同图像评估文本到图像模型
计算机视觉与模式识别
2024-11-15 v1
摘要
扩散模型在图像生成领域焕发了活力,在学术研究和艺术表达中发挥着关键作用。随着新型扩散模型的涌现,评估文本到图像模型的性能变得越来越重要。当前的指标侧重于直接匹配输入文本与生成图像,但由于跨模态信息的不对称,这导致评估结果不可靠或不完整。为此,我们在本研究中引入图像再生任务,通过让 T2I 模型根据参考图像生成图像来评估文本到图像模型。我们使用 GPT4V 作为桥梁,将参考图像与文本输入之间的差距连接起来,使 T2I 模型能够理解图像内容。这种评估过程简化为在生成图像与参考图像之间的直接比较。我们引入两个覆盖内容多样性和风格多样性评估的数据集,用于评估当前可用的领先扩散模型。此外,我们提出 ImageRepainter 框架,通过通过 MLLM 指导的迭代生成和修订来提高生成图像的内容理解质量。我们的全面实验展示了该框架在评估模型生成能力方面的有效性。通过利用 MLLM,我们证明了强大的 T2M 可产生更贴近参考图像的图像。
引用
@article{arxiv.2411.09449,
title = {Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models},
author = {Chutian Meng and Fan Ma and Jiaxu Miao and Chi Zhang and Yi Yang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2411.09449},
year = {2024}
}