中文

闭环融合:利用图网络统一语义对象与视觉特征以处理多对象场景

计算机视觉与模式识别 2022-09-27 v1 机器人学

摘要

在同步定位与建图(SLAM)中,回环检测(LCD)对于在识别曾到访过的地点时最小化漂移至关重要。视觉词袋(vBoW)一直是许多最先进SLAM系统的首选LCD算法。它使用一组视觉特征提供鲁棒的地点识别,但无法感知特征点之间的语义或空间关系。既往工作主要通过将vBoW与场景中对象的语义和空间信息结合来解决这些问题,然而它们无法利用局部视觉特征的空间信息,且缺乏统一语义对象与视觉特征的结构,从而限制了两个组件之间的共生。本文提出SymbioLCD2,其创建统一图结构以共生方式整合语义对象与视觉特征。我们新颖的基于图的LCD系统通过该统一图结构,应用带时间约束的Weisfeiler-Lehman图核来鲁棒预测回环候选。对所提系统的评估表明,具有融合语义对象与视觉特征的统一图结构提升了LCD预测精度,说明所提图结构在这两种互补组件间提供了强共生。它还优于其他机器学习算法——如SVM、决策树、随机森林、神经网络和基于GNN的图匹配网络。此外,其在比最先进SLAM系统更早检测回环候选方面表现出良好性能,表明统一图结构带来的扩展语义与空间感知显著影响了LCD性能。

关键词

引用

@article{arxiv.2209.11894,
  title  = {Closing the Loop: Graph Networks to Unify Semantic Objects and Visual Features for Multi-object Scenes},
  author = {Jonathan J. Y. Kim and Martin Urschler and Patricia J. Riddle and Jörg S. Wicker},
  journal= {arXiv preprint arXiv:2209.11894},
  year   = {2022}
}

备注

8 pages. Accepted at 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)