中文

O3N:面向全视野开放词汇占据预测

计算机视觉与模式识别 2026-03-13 v1 机器人学 图像与视频处理

摘要

通过全视野感知理解和重建 3D 世界是自主智能体和具身智能发展不可避免的趋势。然而,现有的 3D 占据预测方法受限于有限的视角输入和预定义的训练分布,难以应用于需要综合且安全感知在开放世界探索中场景的具身智能体。为此,我们提出了 O3N,即首个纯视觉的、端到端的全视野开放词汇占据预测框架。O3N 通过 Polar-spiral Mamba (PsM) 模块将全视野体素嵌入极坐标螺旋拓扑,实现连续的空间表示和跨 360{\deg} 的长程上下文建模。Occupancy Cost Aggregation (OCA) 模块引入了一种原则化的机制,用于在体素空间中统一几何和语义监督,确保重建的几何与底层语义结构一致。此外,Natural Modality Alignment (NMA) 建立了一个无梯度的对齐路径,将视觉特征、体素嵌入和文本语义调和在一起,形成一致的“像素-体素-文本”表示三位一体。广泛的实验表明,我们的方法不仅在 QuadOcc 和 Human360Occ 基准上实现了最先进的性能,而且在跨场景泛化和语义可扩展性方面表现突出,为通用的 3D 世界建模之路打开了大门。源码将在 https://github.com/MengfeiD/O3N 上公开。

关键词

引用

@article{arxiv.2603.12144,
  title  = {O3N: Omnidirectional Open-Vocabulary Occupancy Prediction},
  author = {Mengfei Duan and Hao Shi and Fei Teng and Guoqiang Zhao and Yuheng Zhang and Zhiyong Li and Kailun Yang},
  journal= {arXiv preprint arXiv:2603.12144},
  year   = {2026}
}

备注

The source code will be made publicly available at https://github.com/MengfeiD/O3N