中文

DeepSeqSLAM:用于联合全局描述与基于序列的位置识别的可训练 CNN+RNN

计算机视觉与模式识别 2020-11-18 v1 人工智能 机器学习 机器人学

摘要

用于全天候导航的基于序列的位置识别方法以在极具挑战的昼夜或夏冬转换下产生最先进的结果而著称。然而,这些系统依赖于复杂的手工启发式序列匹配——应用于单一路径上参考与查询图像序列之间预计算的成对相似度矩阵之上——以相比单帧检索方法进一步降低误报率。因此,执行多帧位置识别在自动驾驶车辆部署或大型数据集评估时可能极其缓慢,且在使用较短参数值(如序列长度为 2 帧)时失效。本文提出 DeepSeqSLAM:一种可训练的 CNN+RNN 架构,用于从单一路径的单目图像序列中联合学习视觉与位置表示。我们在两个大型基准数据集 Nordland 和 Oxford RobotCar 上验证了方法——分别记录于 728 km 和 10 km 路径上,各在 1 年内涵盖多季节、天气与光照条件。在 Nordland 上,我们使用序列长度 2 将方法与两种最先进的基于序列的方法在整个路径的夏冬变化下比较,结果表明我们的方法可获得超过 72% 的 AUC,而 Delta Descriptors 为 27%、SeqSLAM 为 2%;同时将部署时间从约 1 小时大幅缩减至 1 分钟。框架代码与视频见 https://mchancan.github.io/deepseqslam

关键词

引用

@article{arxiv.2011.08518,
  title  = {DeepSeqSLAM: A Trainable CNN+RNN for Joint Global Description and Sequence-based Place Recognition},
  author = {Marvin Chancán and Michael Milford},
  journal= {arXiv preprint arXiv:2011.08518},
  year   = {2020}
}

备注

9 pages, 6 figures, 2 tables