中文

用图像到文本生成评估文本到视觉生成

计算机视觉与模式识别 2024-06-19 v2 人工智能 计算与语言 机器学习 多媒体

摘要

尽管生成式AI取得了显著进展,但由于缺乏有效的指标和标准化基准,全面评估仍然具有挑战性。例如,广泛使用的CLIPScore衡量(生成的)图像与文本提示之间的对齐程度,但对于涉及对象、属性和关系组合的复杂提示,它无法产生可靠的分数。原因之一是CLIP的文本编码器臭名昭著地充当“词袋”,混淆了诸如“马在吃草”和“草在吃马”这样的提示。为了解决这个问题,我们引入了VQAScore,它使用视觉问答(VQA)模型,通过计算对简单问题“这张图是否展示了‘{文本}’?”回答“是”的概率来产生对齐分数。尽管比现有技术更简单,但使用现成模型计算的VQAScore在多个(8个)图像-文本对齐基准上产生了最先进的结果。我们还使用遵循文献最佳实践的内部模型计算VQAScore。例如,我们使用双向图像-问题编码器,允许图像嵌入依赖于所问的问题(反之亦然)。我们的内部模型CLIP-FlanT5甚至优于使用专有GPT-4V的最强基线。有趣的是,尽管我们只使用图像进行训练,但VQAScore也可以对齐文本与视频和3D模型。VQAScore允许研究人员使用捕捉真实世界提示组合结构的复杂文本来基准测试文本到视觉生成。我们引入了GenAI-Bench,这是一个更具挑战性的基准,包含1,600个组合文本提示,需要解析场景、对象、属性、关系以及比较和逻辑等高级推理。GenAI-Bench还提供了超过15,000个人工评分,用于领先的图像和视频生成模型,如Stable Diffusion、DALL-E 3和Gen2。

关键词

引用

@article{arxiv.2404.01291,
  title  = {Evaluating Text-to-Visual Generation with Image-to-Text Generation},
  author = {Zhiqiu Lin and Deepak Pathak and Baiqi Li and Jiayao Li and Xide Xia and Graham Neubig and Pengchuan Zhang and Deva Ramanan},
  journal= {arXiv preprint arXiv:2404.01291},
  year   = {2024}
}

备注

We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore