SANEval:具备失效模式诊断的开放词汇组成性基准
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
文本到图像(T2I)模型的快速进步 unlock 了前所未有的创造潜力,但其忠实渲染涉及多个对象、属性和空间关系的复杂提示的能力仍是一个显著的瓶颈。进展受限于缺乏充分的评估方法;当前的基准通常受限于封闭词汇表,缺乏细粒度诊断能力,无法提供诊断和补救特定组成性失效所必需的可解释反馈。我们通过引入SANEval(Spatial, Attribute, and Numeracy Evaluation),一个综合性基准,来解决这些挑战。SANEval 结合了大型语言模型(LLM)进行深层提示理解,以及 LLM 增强的开放词汇目标检测器,以可靠地评估组成性遵循情况,超越固定词汇表的限制。通过对六个最先进的 T2I 模型进行大量实验,我们展示 SANEval 的自动化评估更能代表人类评估;我们的指标在属性绑定、空间关系和数感任务中与现有基准不同,实现了 Spearman's rank 相关性。为促进组合 T2I 生成和评估的未来研究,我们将发布 SANEval 数据集及我们的开源评估管道。
引用
@article{arxiv.2602.00249,
title = {SANEval: Open-Vocabulary Compositional Benchmarks with Failure-mode Diagnosis},
author = {Rishav Pramanik and Ian E. Nielsen and Jeff Smith and Saurav Pandit and Ravi P. Ramachandran and Zhaozheng Yin},
journal= {arXiv preprint arXiv:2602.00249},
year = {2026}
}