OmniMap:集成光学、几何与语义的通用映射框架
机器人学
2025-09-10 v1
摘要
机器人系统需要准确且全面的3D环境感知,要求同时捕获照片级外观(光学)、精确布局形状(几何)以及开放词汇场景理解(语义)。现有方法通常只能部分满足这些要求,且存在光学模糊、几何不规则和语义模糊的问题。为此,我们提出OmniMap。总体而言,OmniMap是首个能够在保持实时性能和模型紧凑性的同时,同时捕获光学、几何和语义场景属性的在线映射框架。在架构层面,OmniMap采用紧密耦合的3DGS-Voxel混合表示,结合细粒度建模与结构稳定性。在实现层面,OmniMap识别不同模态中的关键挑战,提出了若干创新措施:用于运动模糊和曝光补偿的自适应相机建模、带法向约束的混合增量表示,以及用于稳健实例级理解的概率融合。大量实验表明,OmniMap在渲染保真度、几何精度和零样本语义分割方面均优于现有方法,适用于多样化场景。在下游应用方面,本框架的灵活性体现在包括多域场景问答、交互式编辑、感知引导的操控和地图辅助导航等多种应用。
引用
@article{arxiv.2509.07500,
title = {OmniMap: A General Mapping Framework Integrating Optics, Geometry, and Semantics},
author = {Yinan Deng and Yufeng Yue and Jianyu Dou and Jingyu Zhao and Jiahui Wang and Yujie Tang and Yi Yang and Mengyin Fu},
journal= {arXiv preprint arXiv:2509.07500},
year = {2025}
}
备注
Accepted by IEEE Transactions on Robotics (TRO), project website: https://omni-map.github.io/