DepthArb:面向遮挡鲁棒图像合成的无训练深度仲裁生成
计算机视觉与模式识别
2026-03-26 v1
摘要
文本到图像扩散模型在合成多个对象的准确遮挡关系方面常常表现不足,尤其是在密集重叠区域。现有的无训练布局引导方法主要依赖刚性空间先验,对深度顺序保持不敏感,常导致概念混合或逻辑不清晰。为此,我们提出 DepthArb,一个无训练框架,通过仲裁来解决遮挡模糊问题。具体而言,DepthArb 采用两种核心机制:注意力仲裁调制 (Attention Arbitration Modulation, AAM),通过抑制重叠区域的背景激活来强制深度排序的可见性;以及空间紧凑性控制 (Spatial Compactness Control, SCC),通过约束注意力发散来保持结构完整性。这些机制使我们能够在无需模型重新训练的情况下实现稳健的遮挡生成。为系统评估此能力,我们提出 OcclBench,一个综合基准,用于评估各种遮挡情景。广泛的评估表明,DepthArb 在遮挡准确性和视觉保真度方面 consistently 优于最先进的基线方法。作为即插即用的方法,DepthArb 无缝地增强了扩散模型主干网络的组合能力,为生成模型中的空间层次提供了一种新视角。
引用
@article{arxiv.2603.23924,
title = {DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis},
author = {Hongjin Niu and Jiahao Wang and Xirui Hu and Weizhan Zhang and Lan Ma and Yuan Gao},
journal= {arXiv preprint arXiv:2603.23924},
year = {2026}
}