基于扩散模型的多对象阴影生成:用于图像合成的 MultiShadow
计算机视觉与模式识别
2026-03-06 v3
摘要
真实阴影生成对于实现无缝图像合成至关重要,但现有方法主要关注单对象插入,往往难以在多个前景对象同时插入背景场景时泛化。实际情况下,现代合成管线和实际应用常需同时插入多个对象,因而需要阴影在几何、附着和位置方面保持一致。本文针对多对象阴影生成这一较少探讨的问题,旨在合成多个插入对象的物理上合理阴影。我们利用预训练文本到图像扩散模型的多模态能力。图像路径引入密集的多尺度特征以提供细粒度的空间指导,文本路径将每个对象的阴影边界框编码为学习得到的positional token,并通过交叉注意力进行融合。注意力对齐损失进一步将这些 token 对准其对应的阴影区域。为支持该任务,我们在 DESOBAv2 数据集上进行数据增强,构建包含多个插入对象的复合场景,并自动推导结合对象类别与阴影位置信息的提示词。实验结果表明,我们的方法在单对象和多对象阴影生成设置下均实现了最先进的性能。
引用
@article{arxiv.2603.02743,
title = {MultiShadow: Multi-Object Shadow Generation for Image Compositing via Diffusion Model},
author = {Waqas Ahmed and Dean Diepeveen and Ferdous Sohel},
journal= {arXiv preprint arXiv:2603.02743},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication