中文

定位即你所评估之物:在线地图构建数据集中的数据泄露及其修复方法

计算机视觉与模式识别 2024-04-08 v2

摘要

在线地图构建的任务是利用当前传感器观测(例如来自激光雷达和相机)预测局部地图,而不依赖预先构建的地图。当前最先进的方法基于监督学习,且主要使用两个数据集进行训练:nuScenes 和 Argoverse 2。然而,这些数据集在训练集、验证集和测试集中重复访问了相同的地理位置。具体而言,nuScenes 中超过 8080% 以及 Argoverse 2 中 4040% 的验证集和测试集样本与训练集样本的距离不到 55 米。在测试时,这些方法实际上更多是在评估其如何在由训练数据构建的记忆化隐式地图内进行定位,而非外推至未见过的位置。自然地,这种数据泄露导致了虚高的性能指标,我们提出使用地理上不相交的数据划分来揭示在未见环境中的真实性能。实验结果表明,在适当的数据划分上进行训练和评估时,方法的性能显著下降,部分方法的 mAP 下降超过 4545。此外,对先前设计选择的重新评估揭示了与基于原始划分所得结论相左的结论。值得注意的是,提升方法及辅助任务(例如深度监督)对性能的影响似乎不如先前认为的那样显著,或遵循了不同的变化轨迹。数据划分可在 https://github.com/LiljaAdam/geographical-splits 获取。

关键词

引用

@article{arxiv.2312.06420,
  title  = {Localization Is All You Evaluate: Data Leakage in Online Mapping Datasets and How to Fix It},
  author = {Adam Lilja and Junsheng Fu and Erik Stenborg and Lars Hammarstrand},
  journal= {arXiv preprint arXiv:2312.06420},
  year   = {2024}
}