中文

OccScene:基于语义占用的跨任务互学 3D 场景生成

计算机视觉与模式识别 2025-08-25 v2

摘要

近期的扩散模型在 3D 场景生成和感知任务中均展现出了卓越的性能。然而,现有方法通常将这两个过程分开,作为数据增强器为下游感知任务生成合成数据。在这项工作中,我们提出了 OccScene,一种新颖的互学习范式,将细粒度 3D 感知与高质量生成集成在一个统一框架中,实现了跨任务的双赢效果。OccScene 仅依赖文本提示,在联合训练扩散框架中以语义占用为引导,生成新颖且一致的 3D 真实场景。为了将占用与扩散潜空间对齐,引入了基于 Mamba 的双重对齐模块,以将细粒度语义和几何作为感知先验纳入。在 OccScene 中,感知模块可以通过定制和多样化的生成场景得到有效改进,而感知先验反过来又增强了生成性能,从而实现互利。大量实验表明,OccScene 在广泛的室内和室外场景中实现了逼真的 3D 场景生成,同时提升了感知模型,使其在语义占用预测的 3D 感知任务中取得了显著的性能提升。

关键词

引用

@article{arxiv.2412.11183,
  title  = {OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation},
  author = {Bohan Li and Xin Jin and Jianan Wang and Yukai Shi and Yasheng Sun and Xiaofeng Wang and Zhuang Ma and Baao Xie and Chao Ma and Xiaokang Yang and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2412.11183},
  year   = {2025}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence