中文

CrossLoc:由多模态合成数据辅助的可扩展空中定位

计算机视觉与模式识别 2022-03-31 v5 人工智能 机器人学

摘要

我们提出了一种视觉定位系统,该系统学习在合成数据的帮助下估计真实世界中的相机位姿。尽管近年来取得了重大进展,但大多数基于学习的视觉定位方法都针对单一领域,并且需要密集的带有地理标签的图像数据库才能良好运行。为了缓解数据稀缺问题并提高神经定位模型的可扩展性,我们引入了 TOPO-DataGen,这是一种多功能合成数据生成工具,以地理相机视点为枢纽,在真实与虚拟世界之间平滑过渡。我们提出了新的大规模 sim-to-real 基准数据集,以展示和评估上述合成数据的效用。我们的实验表明,合成数据普遍增强了神经网络在真实数据上的性能。此外,我们引入了 CrossLoc,一种用于位姿估计的跨模态视觉表示学习方法,通过自监督充分利用场景坐标真值。无需任何额外数据,CrossLoc 即显著优于 SOTA 方法,并实现了大幅提升的真实数据样本效率。我们的代码和数据集均可在 https://crossloc.github.io/ 获取。

关键词

引用

@article{arxiv.2112.09081,
  title  = {CrossLoc: Scalable Aerial Localization Assisted by Multimodal Synthetic Data},
  author = {Qi Yan and Jianhao Zheng and Simon Reding and Shanci Li and Iordan Doytchinov},
  journal= {arXiv preprint arXiv:2112.09081},
  year   = {2022}
}

备注

CVPR 2022. Project page: https://crossloc.github.io/