PerLDiff:基于透视-布局扩散模型的可控街景合成
计算机视觉与模式识别
2025-07-16 v5
摘要
可控生成被视为解决3D数据标注挑战的关键方法,而在自动驾驶数据生产的背景下,可控生成的精度尤为重要。现有方法侧重于将多样化的生成信息整合到控制输入中,利用GLIGEN或ControlNet等框架,以获得良好的可控生成效果。然而,这些方法本质上受限于预定义网络架构的学习能力。在本文中,我们探索了控制信息与生成信息的创新集成,引入PerLDiff(Perspective-Layout Diffusion Models),一种新型的有效街景图像生成方法,充分利用透视3D几何信息。在PerLDiff中,我们采用3D几何先验引导街景图像的生成,在网络学习过程中实现精确的对象级控制,从而产生更稳健且可控的输出。此外,该方法在替代布局控制方法方面表现出优越的可控性。实验结果表明,PerLDiff在NuScenes和KITTI数据集上显著提升了可控生成的精度。
引用
@article{arxiv.2407.06109,
title = {PerLDiff: Controllable Street View Synthesis Using Perspective-Layout Diffusion Models},
author = {Jinhua Zhang and Hualian Sheng and Sijia Cai and Bing Deng and Qiao Liang and Wen Li and Ying Fu and Jieping Ye and Shuhang Gu},
journal= {arXiv preprint arXiv:2407.06109},
year = {2025}
}
备注
Accepted by ICCV 2025