中文

用于改善大型语言模型中3D空间推理的可扩展对象关系编码

计算机视觉与模式识别 2026-03-27 v1 人工智能 机器学习 多媒体

摘要

空间推理旨在基于3D场景中的空间关系定位目标对象,这在开发智能具身智能体方面发挥着关键作用。由于3D场景语言配对数据的可得性有限,训练具备强大推理能力的模型具有挑战。以往方法尝试将3D场景表示注入到大型语言模型(LLM)的输入空间中,并利用预训练的理解与推理能力进行空间推理。然而,编码绝对位置的模型难以从过早融合的特征中提取空间关系,而将所有空间关系(对象数量的二次方)显式编码为输入标记的方法则在可扩展性方面存在问题。为解决这些限制,我们提出QuatRoPE,这是一种与对象数量呈线性关系的新型位置嵌入方法,通过注意力层中的点积显式计算成对空间关系。QuatRoPE对3D坐标的整体向量编码保证了高度的空间一致性,保持了场景几何完整性。此外,我们引入孤立门控RoPE扩展(IGRE),有效将QuatRoPE的影响限制在与对象相关的标记上,从而最小化对LLM现有位置嵌入的干扰,保持LLM的原始能力。大量实验表明,我们的方法有效。代码和数据可在 https://github.com/oceanflowlab/QuatRoPE 获取。

关键词

引用

@article{arxiv.2603.24721,
  title  = {Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models},
  author = {Shengli Zhou and Minghang Zheng and Feng Zheng and Yang Liu},
  journal= {arXiv preprint arXiv:2603.24721},
  year   = {2026}
}

备注

Accepted by CVPR 2026