中文

M3:3D 空间多模态记忆

计算机视觉与模式识别 2025-03-21 v1 机器人学

摘要

我们提出了 3D 空间多模态记忆 (M3),这是一种多模态记忆系统,旨在通过视频源为视觉感知保留关于中型静态场景的信息。通过将 3D Gaussian Splatting 技术与基础模型相结合,M3 构建了一个多模态记忆,能够跨粒度渲染特征表示,涵盖广泛的知识。在探索过程中,我们发现了先前特征溅射工作中的两个关键挑战:(1) 为每个 Gaussian 基元存储高维特征的计算约束,以及 (2) 蒸馏特征与基础模型特征之间的错位或信息丢失。为了应对这些挑战,我们提出了包含主场景组件和 Gaussian 记忆注意力等关键组件的 M3,从而实现高效的训练与推理。为了验证 M3,我们对特征相似性和下游任务进行了全面的定量评估,并进行了定性可视化以突出 Gaussian 记忆注意力的像素轨迹。我们的方法涵盖了多种基础模型,包括视觉语言模型 (VLM)、感知模型以及大型多模态和语言模型 (LMM/LLM)。此外,为了展示其在现实世界中的适用性,我们将 M3 的特征场部署在四足机器人上的室内场景中。值得注意的是,我们声称 M3 是首个解决 3D 特征蒸馏中核心压缩挑战的工作。

关键词

引用

@article{arxiv.2503.16413,
  title  = {M3: 3D-Spatial MultiModal Memory},
  author = {Xueyan Zou and Yuchen Song and Ri-Zhao Qiu and Xuanbin Peng and Jianglong Ye and Sifei Liu and Xiaolong Wang},
  journal= {arXiv preprint arXiv:2503.16413},
  year   = {2025}
}

备注

ICLR2025 homepage: https://m3-spatial-memory.github.io code: https://github.com/MaureenZOU/m3-spatial