中文

超出提示符的对齐:评估文本到图像生成中的世界知识对齐

计算机视觉与模式识别 2025-05-27 v1

摘要

最近的文本到图像(T2I)生成模型取得了显著进展,使能够从文本提示中创建高保真图像。然而,现有的评估基准主要关注生成图像与提示之间的显式对齐,忽略了超出提示之外的世界知识对齐。为填补这一差距,我们引入Align Beyond Prompts(ABP),一个综合性基准,旨在衡量生成图像与超出明确用户提示的世界知识的对齐程度。ABP包含超过2000个精心策划的提示,涵盖六个不同场景中的世界知识。我们进一步引入了ABPScore,该指标利用现存的多模态大型语言模型(MLLM)来评估生成图像与超出提示的世界知识的对齐程度,显示出与人类判断的强相关性。通过使用ABP对8个流行的T2I模型进行全面评估,我们发现即使是最先进的模型,如GPT-4o,在将简单世界知识整合到生成图像中也面临局限。为缓解这一问题,我们在ABP中引入了一个名为Inference-Time Knowledge Injection(ITKI)的训练自由策略。通过对这200个具有挑战性的样本应用此策略,我们在ABPScore上实现了约43%的提升。数据集和代码均可在https://github.com/smile365317/ABP获取。

关键词

引用

@article{arxiv.2505.18730,
  title  = {Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation},
  author = {Wenchao Zhang and Jiahe Tian and Runze He and Jizhong Han and Jiao Dai and Miaomiao Feng and Wei Mi and Xiaodan Zhang},
  journal= {arXiv preprint arXiv:2505.18730},
  year   = {2025}
}

备注

Code: https://github.com/smile365317/ABP