中文

M3DMap:面向动态环境的对象感知多模态三维映射

计算机视觉与模式识别 2025-08-26 v1 机器人学

摘要

动态环境中的三维映射是现代机器人和自动驾驶领域的挑战。目前缺乏能够融合图像、点云和文本等多模态数据的动态三维场景的通用表示方法。本文致力于解决此问题。文章提出了一种构建多模态三维地图的方法学分类体系,依据场景类型、表征方式、学习方法和实际应用进行归类。基于该分类体系,本文提供了近期方法的简要结构化分析。文章还描述了一种原创的模块化方法——M3DMap,旨用于构建适用于静态和动态场景的对象感知多模态三维地图。其包括多个相互关联的组件:神经网络多模态对象分割与跟踪模块;基于可训练算法的里程计估计模块;用于构建和更新三维地图的模块,可根据所需的场景表征方式进行 various 实现;以及多模态数据检索模块。文章突出了这些模块的原创实现及其在解决各种实际任务(如三维对象定位和移动操作)方面的优势。此外,本文提出了理论命题,证明了在三维映射方法中使用多模态数据和现代基础模型的积极效果。该方法学和实现细节可在 https://yuddim.github.io/M3DMap 查看。

关键词

引用

@article{arxiv.2508.17044,
  title  = {M3DMap: Object-aware Multimodal 3D Mapping for Dynamic Environments},
  author = {Dmitry Yudin},
  journal= {arXiv preprint arXiv:2508.17044},
  year   = {2025}
}

备注

29 pages, 3 figures, 13 tables. Preprint of the accepted article in Optical Memory and Neural Network Journal