OcclusionFormer:面向布局导向图像生成的Z序排列
计算机视觉与模式识别
2026-05-21 v1
摘要
最近的布局到图像模型在空间可控性方面取得了显著进展。然而,他们仍在处理inter-object遮挡时存在困难。当边界框重叠时,大多数现有方法缺乏显式的遮挡信息,导致交叉区域的生成本质上是模糊的,阻碍了复杂遮挡关系的确定。结果往往会产生纠缠的纹理或在重叠区域产生物理不一致的图层。为解决此问题,我们首先构建了包含显式遮挡顺序和像素级注释的大规模数据集SA-Z。基于我们提出的数据集,我们引入OcclusionFormer,一种新颖的感知注意力扩散Transformer框架,显式建模Z序优先级,通过解耦实例并采用体渲染合成来实现。此外,为确保细粒度的空间精度,我们引入了查询对齐loss,显式监督单个实例并增强语义一致性。我们的方法有效减少了重叠区域的模糊性,强制正确的遮挡依赖,同时保持结构完整性,在多样化场景中实现了显著的精度提升。
关键词
引用
@article{arxiv.2605.21343,
title = {OcclusionFormer: Arranging Z-Order for Layout-Grounded Image Generation},
author = {Ziye Li and Henghui Ding},
journal= {arXiv preprint arXiv:2605.21343},
year = {2026}
}
备注
ICML 2026, Project Page: https://henghuiding.com/OcclusionFormer/