CymbaDiff:用于草图基 3D 语义城市场景生成的结构化空间扩散
计算机视觉与模式识别
2026-01-21 v3
摘要
户外 3D 语义场景生成为城市模拟和自动驾驶等应用提供了逼真且语义丰富的环境,但这一方向的进展受限于缺乏公开且标注完善的数据集。我们引入 SketchSem3D,这是首个大规模基准数据集,用于从抽象手绘草图和伪标注卫星图像生成 3D 户外语义场景。SketchSem3D 包含两个子集:Sketch-based SemanticKITTI 和 Sketch-based KITTI-360(包含 LiDAR 体素及其对应的草图和标注卫星图像),以实现标准化、严谨且多样化的评估。我们还提出了 Cylinder Mamba Diffusion (CymbaDiff),显著提升户外 3D 场景生成的空间一致性。CymbaDiff 施加结构化空间排序,显式捕获圆柱连续性和垂直层次结构,同时保持物理邻域关系和全局语境。在 SketchSem3D 上进行的大量实验表明,CymbaDiff 在语义一致性、空间真实性和跨数据集泛化方面均表现优异。代码和数据集将在 https://github.com/Lillian-research-hub/CymbaDiff 上提供。
引用
@article{arxiv.2510.13245,
title = {CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation},
author = {Li Liang and Bo Miao and Xinyu Wang and Naveed Akhtar and Jordan Vice and Ajmal Mian},
journal= {arXiv preprint arXiv:2510.13245},
year = {2026}
}
备注
Accepted by NeurIPS 2025