中文

ToLo:面向高重叠布局的无训练布局至图像生成框架

计算机视觉与模式识别 2025-03-04 v1

摘要

近期的无训练布局至图像扩散模型在生成可控布局的高质量图像方面表现突出。这些模型遵循单阶段框架:通过定义基于注意力图的损失函数,引导模型将每个概念的注意力图聚焦于其对应的区域。然而,这些模型在处理显著重叠的布局时仍难以准确跟随,常导致属性泄漏和实体缺失。本文提出 ToLo,一个面向高重叠布局的两阶段、无训练布局至图像生成框架。框架包含聚合阶段和分离阶段,各自基于注意力图设计损失函数。为提供更有效的评估,我们依据输入布局的交并比 (IoU) 将 HRS 数据集进行分层,构建布局至图像生成的新数据集。通过在该数据集上进行大量实验,我们展示 ToLo 在处理高重叠布局时显著提升了现有方法的性能。我们的代码和数据集已公开:https://github.com/misaka12435/ToLo。

关键词

引用

@article{arxiv.2503.01667,
  title  = {ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts},
  author = {Linhao Huang and Jing Yu},
  journal= {arXiv preprint arXiv:2503.01667},
  year   = {2025}
}