中文

UniLayDiff:用于内容感知布局生成的统一扩散 Transformer

计算机视觉与模式识别 2025-12-10 v1

摘要

内容感知布局生成是图形设计自动化中的关键任务,专注于创建与给定背景图像无缝融合的视觉美观元素排列。现实世界应用的多样性使得开发能够统一多样化输入约束生成子任务的单一模型极具挑战性,例如由元素类型、尺寸或其关系所约束的任务。当前方法要么只解决这些任务的子集,要么需要为不同条件设置独立的模型参数,无法提供真正的统一解决方案。在本文中,我们提出了 UniLayDiff:一个统一扩散 Transformer,首次通过一个端到端可训练模型解决了各种内容感知布局生成任务。具体而言,我们将布局约束视为一种独立模态,并采用多模态扩散 Transformer 框架来捕捉背景图像、布局元素和多样化约束之间的复杂交互。此外,我们通过在预训练于其他任务的模型上使用 LoRA 微调来集成关系约束。这种方案不仅实现了统一条件生成,还提升了整体布局质量。大量实验表明,UniLayDiff 在从无条件到各种条件生成任务上取得了最先进的性能,并且据我们所知,是首个统一完整内容感知布局生成任务范围的模型。

关键词

引用

@article{arxiv.2512.08897,
  title  = {UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation},
  author = {Zeyang Liu and Le Wang and Sanping Zhou and Yuxuan Wu and Xiaolong Sun and Gang Hua and Haoxiang Li},
  journal= {arXiv preprint arXiv:2512.08897},
  year   = {2025}
}