中文

PanoWorld:面向 360 度全景世界的空间超感知

计算机视觉与模式识别 2026-05-18 v2 人工智能

摘要

多模态大语言模型 (MLLM) 在以单一视角图像为主导范式的情况下仍难以处理空间理解问题,这种范式继承了类人感知的窄域视野。对于导航、机器人搜索和 3D 场景理解,360 度全景感知以一次性捕获整个周围环境的方式提供了超感知能力。然而,现有的 MLLM 管道通常将全景分解为多个视角图像,使以圆柱等距投影 (ERP) 为主体的球面结构几乎保持为隐式。本文研究全景原生理解,这需要 MLLM 对 ERP 全景作为连续、以观察者为中心的空间进行推理。为此,我们首先定义了全景原生理解的关键能力,包括语义锚定、球面定位、参考系变换和深度感知的 3D 空间推理。随后,我们构建了一个大规模元数据构建管道,将混合来源的 ERP 全景转换为几何感知、语言对齐和深度感知的监督信号,并将这些信号实例化为能力对齐的指令调优数据。在模型层面,我们引入了具备球面空间跨注意力机制的 PanoWorld,并进一步构建了 PanoSpace-Bench 用于评估 ERP 原生空间推理的诊断基准。实验表明,PanoWorld 在 PanoSpace-Bench、H* Bench 和 R2R-CE Val-Unseen 基准上显著优于专有和开源基线。这表明,健全的全景推理需要专门的全景原生监督和几何感知模型适配。所有源代码和提出的数据将公开发布。

关键词

引用

@article{arxiv.2605.13169,
  title  = {PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World},
  author = {Changpeng Wang and Xin Lin and Junhan Liu and Yuheng Liu and Zhen Wang and Donglian Qi and Yunfeng Yan and Xi Chen},
  journal= {arXiv preprint arXiv:2605.13169},
  year   = {2026}
}

备注

Project page: https://wcpcp.github.io/PanoWorld