中文

基于边缘注意力约束的无训练布局到图像生成

计算机视觉与模式识别 2026-03-24 v3

摘要

近期,许多文本到图像扩散模型擅长从文本生成高分辨率图像,但在空间构图和物体计数的精确控制上表现不足。为应对这些挑战,先前工作开发了布局到图像(L2I)方法,将布局指令融入文本到图像模型。然而,现有 L2I 方法通常需要微调预训练参数或为扩散模型训练额外的控制模块。本文提出一种无训练 L2I 方法 MAC(边缘注意力约束生成),无需额外模块或微调。具体而言,我们利用文本-视觉交叉注意力特征图量化生成图像布局与给定指令之间的不一致,并计算损失函数在扩散反向过程中优化潜在特征。为增强空间可控性并缓解复杂布局指令下的语义失效,我们利用自注意力特征图中的像素级相关性对齐交叉注意力图,并结合三个由边界注意力约束的损失函数更新潜在特征。在 L2I 和非 L2I 预训练扩散模型上的综合实验表明,本方法在 DrawBench 和 HRS 基准上从定量和定性两方面均优于现有无训练 L2I 技术。

关键词

引用

@article{arxiv.2411.10495,
  title  = {Training-Free Layout-to-Image Generation with Marginal Attention Constraints},
  author = {Huancheng Chen and Jingtao Li and Weiming Zhuang and Haris Vikalo and Lingjuan Lyu},
  journal= {arXiv preprint arXiv:2411.10495},
  year   = {2026}
}