中文

无需训练的布局到图像控制与真实性:两者兼得

计算机视觉与模式识别 2025-06-19 v1

摘要

布局到图像生成旨在创建具有精确控制主体放置和排列的复杂场景。现有工作表明,预训练的文本到图像扩散模型可以在特定数据上进行零样本训练即可实现此目标,但常面临局部化不准和不真实痕迹的挑战。我们聚焦于这些缺点,提出了一种新颖的无训练方法 WinWinLay。其核心是两种关键策略:非局部注意力能量函数和自适应更新,协同增强控制精度和真实性。一方面,我们理论地表明,常用的注意力能量函数引入了固有的空间分布偏差,阻碍对象均匀对齐布局指令。为克服此问题,探索非局部注意力先验以重新分配注意力得分,促进对象更好地符合指定的空间条件。另一方面,我们识别到常规反向传播更新规则会导致偏离预训练领域,引发分布外痕迹。因此,我们引入基于Langevin动力学的自适应更新方案作为补救措施,既遵循布局约束,又促进领域内更新。广泛实验表明,WinWinLay 在控制元素放置和实现照片级视觉保真度方面表现卓越,超越当前最先进的方法。

关键词

引用

@article{arxiv.2506.15563,
  title  = {Control and Realism: Best of Both Worlds in Layout-to-Image without Training},
  author = {Bonan Li and Yinhan Hu and Songhua Liu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2506.15563},
  year   = {2025}
}

备注

Accepted by ICML2025