中文

MetaLogic: 通过逻辑等价提示评估文本到图像模型的鲁棒性

计算机视觉与模式识别 2025-10-02 v1 人工智能

摘要

近期的文本到图像(T2I)模型,特别是基于扩散的架构,显著提升了生成图像的视觉质量。然而,这些模型仍然面临一个关键局限性:在输入提示发生微小语言变化时保持语义一致性。尽管这些提示对偶在逻辑上等价,但常常产生错位或在语义上不一致的图像,暴露了模型在推理和泛化方面的鲁棒性不足。为此,我们提出MetaLogic,一个 novel evaluation framework,用于检测T2I对齐问题,而无需依赖 ground truth图像。MetaLogic利用变形测试,生成来自语法上不同但在语义上相同提示的图像对。通过直接比较这些图像对,框架识别这些不一致性,信号表明模型在保持意图含义方面的失败,有效诊断模型逻辑理解的鲁棒性问题。与现有评估方法不同,MetaLogic评估成对图像之间的语义等价性,而不是将生成图像与单个提示进行比较,提供了一种可扩展、无 ground truth的方法,用于识别对齐失败。它对齐错误进行分类(例如实体遗漏、重复、位置错位),并暴露可用于模型调试和细化的 counterexamples。我们在多个最先进T2I模型上评估MetaLogic,发现各种逻辑构造都存在持续的鲁棒性失败。我们发现,即使是像Flux.dev和DALLE-3这样的SOTA文本到图像模型也分别显示出59%和71%的错位率。我们的结果表明,MetaLogic不仅高效且可扩展,而且在揭示被现有评估指标忽视的细粒度逻辑不一致性方面也同样有效。

关键词

引用

@article{arxiv.2510.00796,
  title  = {MetaLogic: Robustness Evaluation of Text-to-Image Models via Logically Equivalent Prompts},
  author = {Yifan Shen and Yangyang Shu and Hye-young Paik and Yulei Sui},
  journal= {arXiv preprint arXiv:2510.00796},
  year   = {2025}
}

备注

ICFEM 2025