中文

C^2ROPE:面向3D大型多模态模型推理的因果连续旋转位置编码

计算机视觉与模式识别 2026-02-17 v2 人工智能

摘要

近期基于大型语言模型(LLM)构建的3D大型多模态模型(LMM)已确立3D视觉特征与LLM表示对齐为主导范式。然而,继承的旋转位置嵌入(RoPE)为多模态处理带来了局限性。具体而言,应用1D时间位置指数会破坏视觉特征在列维度上的连续性,导致空间局部性丢失。此外,RoPE遵循时间上更接近的图像token更具因果关系的假设,导致注意力分配的长期衰减,使模型在序列长度增加时逐渐忽略早期视觉token。为此,我们提出C^2RoPE,一种改进RoPE,显式建模视觉处理中的局部空间连续性和空间因果关系。C^2RoPE引入一种用于视觉token的时空连续位置嵌入机制。它首先将1D时间位置与基于笛卡尔坐标的空间坐标集成,以构建三元混合位置索引,随后采用频率分配策略对三个索引分量进行时空位置信息编码。此外,我们引入切比雪夫因果掩码,通过计算图像token在2D空间中的切比雪夫距离来确定因果依赖关系。跨多个基准的评估结果,包括3D场景推理和3D视觉问答,证明了C^2RoPE的有效性。代码已在https://github.com/ErikZ719/C2RoPE上提供。

关键词

引用

@article{arxiv.2602.10551,
  title  = {C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning},
  author = {Guanting Ye and Qiyan Zhao and Wenhao Yu and Xiaofeng Zhang and Jianmin Ji and Yanyong Zhang and Ka-Veng Yuen},
  journal= {arXiv preprint arXiv:2602.10551},
  year   = {2026}
}

备注

Accepted in ICRA 2026