中文

LoCUS:从已位姿图像中学习多尺度三维一致特征

计算机视觉与模式识别 2023-10-03 v1 人工智能

摘要

对于机器人和自主智能体而言,维持一个在空间和时间上一致的世界模型是一项重要挑战。该模型必须能在遮挡、先前未见过的视角以及长时间跨度(例如闭环与再识别)下保持。如何在无监督条件下训练这样一种通用神经表示仍是一个开放问题。我们的出发点是:训练目标可框定为块检索问题——给定场景某一视角下的一图像块,我们希望检索(以高精度与高召回率)其他视角中所有映射到同一真实世界位置的块。一个缺陷是该目标不促进特征的可复用性:由于对特定场景唯一(达到完美精度/召回),此类表示在其他场景语境中无用。我们发现,通过仔细构造检索集、略去映射到远处位置的块,可平衡检索与可复用性。类似地,我们可通过调整将某次检索视为正样本的空间容差,轻松调节所学特征的尺度(如点、物体或房间)。我们针对(平滑)平均精度(AP)进行优化,采用单一统一的基于排序的目标。该目标也兼作选择地标或关键点的准则,即具有高 AP 的块。我们展示了构建由高度可识别地标组成的稀疏、多尺度、语义空间地图的结果,其在地标检索、定位、语义分割与实例分割中具有应用。

关键词

引用

@article{arxiv.2310.01095,
  title  = {LoCUS: Learning Multiscale 3D-consistent Features from Posed Images},
  author = {Dominik A. Kloepfer and Dylan Campbell and João F. Henriques},
  journal= {arXiv preprint arXiv:2310.01095},
  year   = {2023}
}