中文

SoPE:基于球坐标的位置编码以提升 3D LVLMs 空间感知

计算机视觉与模式识别 2026-02-27 v1 人工智能

摘要

基于大语言模型 (LLM) 的 3D 大型视觉语言模型 (3D LVLMs) 在various multimodal tasks 上取得显著进展。然而,其继承的位置依赖建模机制(Rotary Position Embedding, RoPE)对 3D 多模态理解仍不够理想。原始 RoPE 公式未能保留点云 token 编码时的关键三维空间结构,其相对距离计算忽略了角度依赖性,阻碍模型捕获视觉表征中方向变化。为此,本文提出球坐标位置编码 (SoPE)。该方法将点云 token 索引映射至 3D 球坐标空间,实现空间位置与方向角的统一建模。该表述保留点云数据的内在几何结构,提升空间感知,为多模态学习提供更一致且富有表现力的几何表征。此外,本文引入多尺度频率混合策略跨不同频率域融合特征信息。多项 3D 场景基准测试的实验结果验证了方法有效性,实际部署实验进一步显示其强大的泛化能力。

关键词

引用

@article{arxiv.2602.22716,
  title  = {SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs},
  author = {Guanting Ye and Qiyan Zhao and Wenhao Yu and Liangyu Yuan and Mingkai Li and Xiaofeng Zhang and Jianmin Ji and Yanyong Zhang and Qing Jiang and Ka-Veng Yuen},
  journal= {arXiv preprint arXiv:2602.22716},
  year   = {2026}
}

备注

CVPR 2026