OnlineSI:驾驭大型语言模型进行在线3D理解与定位
计算机视觉与模式识别
2026-03-09 v2
摘要
近年来,研究者越来越关注如何使多模态大型语言模型(MLLM)具备空间理解与推理能力。然而,大多数现有方法忽视了持续工作于不断变化世界中能力的重要性,且缺乏在实际环境中为具身系统部署的可能性。本文引入OnlineSI框架,可持续改进其对周围环境的空间理解。我们的核心思想是维持有限的空间记忆以保留过往观察,确保空间记忆的大小不会随输入累积而增长。我们进一步将3D点云信息与语义信息融合,帮助MLLM更准确地定位与识别场景中的物体。为评估我们的方法,我们引入模糊F1得分以消除歧义,并在两个代表性数据集上进行测试。实验结果表明,我们的方法有效,为向真实世界具身系统的实现指明了方向。
引用
@article{arxiv.2601.16538,
title = {OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding},
author = {Zixian Liu and Zhaoxi Chen and Liang Pan and Ziwei Liu},
journal= {arXiv preprint arXiv:2601.16538},
year = {2026}
}
备注
Project Page: https://onlinesi.github.io/