SSEditor:基于扩散模型的可控掩码到场景生成
计算机视觉与模式识别
2024-11-20 v1 人工智能
摘要
近期基于 3D 扩散的语义场景生成进展引起了广泛关注。然而,现有方法依赖无条件生成,并且在编辑场景时需要多次重采样步骤,这极大地限制了它们的可控性和灵活性。为此,我们提出了 SSEditor,一种可控的语义场景编辑器,它无需多步重采样即可生成指定的目标类别。SSEditor 采用两阶段基于扩散的框架:(1)训练 3D 场景自编码器以获取潜在三平面特征,以及(2)训练掩码条件扩散模型以实现可定制的 3D 语义场景生成。在第二阶段,我们引入了一个几何-语义融合模块,增强了模型学习几何和语义信息的能力。这确保了生成的物体具有正确的位置、大小和类别。在 SemanticKITTI 和 CarlaSC 上的大量实验表明,SSEditor 在目标生成的可控性和灵活性以及语义场景生成和重建质量方面均优于先前的方法。更重要的是,在未见过的 Occ-3D Waymo 数据集上的实验表明,SSEditor 能够生成新颖的城市场景,从而实现 3D 场景的快速构建。
引用
@article{arxiv.2411.12290,
title = {SSEditor: Controllable Mask-to-Scene Generation with Diffusion Model},
author = {Haowen Zheng and Yanyan Liang},
journal= {arXiv preprint arXiv:2411.12290},
year = {2024}
}