中文

感知空间:面向高效精准 3D 场景理解的轨迹感知视频表示

计算机视觉与模式识别 2026-05-08 v2

摘要

最近的多模态大语言模型(MLLM)在 3D 场景中的空间推理方面显示出巨大的潜力。然而,它们通常依赖计算昂贵的 3D 表示,如点云或重建的鸟瞰图(BEV),或缺乏物理 grounding 以解决比例和尺寸的歧义。本文通过引入惯性测量单元(IMU)同步捕获的轨迹模态数据,显著增强了 MLLM 的能力。具体而言,我们提出一种新框架,称为 Motion-MLLM,包含两个关键组件:(1)一个级联轨迹-视觉关键帧过滤模块,利用 IMU 数据和视觉特征高效选择稀疏且具代表性的关键帧集合;(2)一个非对称跨模态融合模块,其中运动 token 充当中介,将轨迹线索和跨帧视觉上下文导入视觉表示。通过将视觉内容锚定在物理轨迹轨迹上,Motion-MLLM 能够推理关于场景中绝对比例和空间关系。我们的广泛评估表明,Motion-MLLM 在与 3D 场景理解和空间推理相关的各种任务上均实现了显著提升。与基于视频帧和显式 3D 数据的当前方法相比,Motion-MLLM 在精度上持平,同时分别快 1.30 倍和 1.61 倍。

关键词

引用

@article{arxiv.2603.17980,
  title  = {Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding},
  author = {Shuyao Shi and Kang G. Shin},
  journal= {arXiv preprint arXiv:2603.17980},
  year   = {2026}
}

备注

22 pages, 10 figures