中文

通过统一语义-空间评估对闭合与开放场景中的布局引导扩散模型进行基准测试

计算机视觉与模式识别 2026-04-29 v1

摘要

评估布局引导文本到图像生成模型需要同时评估其对文本提示的语义对齐性以及对指定布局的空间保真性。评估布局对齐需要收集细粒度注释,这既费时又费力。因此,当前的基准测试很少提供全面的布局评估,往往在规模或覆盖范围上有限,使得模型的比较、排序和解释变得困难。在本工作中,我们引入了一个闭合集基准测试(C-Bench),旨在隔离 key generative 能力,同时在提示结构和布局的复杂度方面提供不同层次。为补充 this controlled setting,我们提出了一个开放集基准测试(O-Bench),该基准测试使用真实世界的提示和布局,对模型在野外的语义和空间对齐进行评估。我们进一步开发了一个统一的评估协议,将语义和空间准确性整合为单个分数,确保一致的模型排名。使用 our 基准测试,我们对六种最先进的布局引导扩散模型进行了大规模评估,总计评估了 319,086 个生成图像。我们基于 their 整体性能建立了模型排名,并提供详细的文本和布局对齐细分,以增强可解释性。跨场景和提示复杂度的细粒度分析揭示了当前模型的优势和局限性。代码可在 https://github.com/lparolari/cobench 获取。

关键词

引用

@article{arxiv.2604.25358,
  title  = {Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings},
  author = {Luca Parolari and Nicla Faccioli and Lamberto Ballan},
  journal= {arXiv preprint arXiv:2604.25358},
  year   = {2026}
}

备注

Accepted to CVPRF 2026