中文

Voxeland:基于证据的不确定性量化的概率实例感知语义映射

机器人学 2024-11-14 v1

摘要

以人为中心的环境中的机器人需要准确的场景理解以有效执行高层任务。这种理解可通过实例感知语义映射实现,该映射涉及在单个实例层面重建元素。神经网络作为场景理解的事实标准解决方案,仍面临局限,例如对分布外物体做出过度自信的错误预测或生成不准确的掩码。过度依赖这些预测会使重建易受错误影响,降低生成地图的鲁棒性并阻碍机器人操作。本文提出 Voxeland,一种用于增量构建实例感知语义地图的概率框架。受证据理论启发,Voxeland 将神经网络预测视为关于几何和语义两个层面地图实例的主观观点。这些观点随时间聚合形成证据,并通过概率模型形式化。这使我们能量化重建过程中的不确定性,便于识别需改进的地图区域(如需重新观测或重新分类)。作为利用此点的一种策略,我们引入大型视觉-语言模型(LVLM)对高不确定性实例进行语义层面的消歧。在公开可用的 SceneNN 数据集上的标准基准测试结果表明,Voxeland 优于最先进方法,凸显了融合并利用实例级和语义级不确定性以增强重建鲁棒性的优势。这在真实世界的 ScanNet 数据集上的定性实验中得到进一步验证。

关键词

引用

@article{arxiv.2411.08727,
  title  = {Voxeland: Probabilistic Instance-Aware Semantic Mapping with Evidence-based Uncertainty Quantification},
  author = {Jose-Luis Matez-Bandera and Pepe Ojeda and Javier Monroy and Javier Gonzalez-Jimenez and Jose-Raul Ruiz-Sarmiento},
  journal= {arXiv preprint arXiv:2411.08727},
  year   = {2024}
}