中文

面向具身视觉的模态不变视觉里程计

计算机视觉与模式识别 2023-05-02 v1 机器人学

摘要

在真实、含噪环境中有效定位智能体对许多具身视觉任务至关重要。视觉里程计(VO)是不可靠 GPS 与罗盘传感器的实用替代,尤其在室内环境中。尽管基于 SLAM 的方法无需大量数据即表现出稳健性能,但相较于基于学习的方法,它们对噪声与传感器套件变化的灵活性与鲁棒性较弱。然而,近期深度 VO 模型将自己局限于固定的输入模态集合,例如 RGB 与深度,并在数百万样本上训练。当传感器失效、传感器套件改变,或因可用资源(如功耗)而故意停用某些模态时,这些模型会灾难性失效。此外,若无模拟器访问权限或可微调的合适现有模型,从头训练这些模型更为昂贵。尽管此类场景在仿真中多被忽略,它们却普遍阻碍模型在真实应用中的可复用性。我们提出一种基于 Transformer 的模态不变 VO 方法,可应对导航智能体多样或变化的传感器套件。我们的模型仅以一小部分数据训练便优于先前方法。我们希望该方法为可受益于灵活且可学习的 VO 模型的更广泛真实应用打开大门。

关键词

引用

@article{arxiv.2305.00348,
  title  = {Modality-invariant Visual Odometry for Embodied Vision},
  author = {Marius Memmel and Roman Bachmann and Amir Zamir},
  journal= {arXiv preprint arXiv:2305.00348},
  year   = {2023}
}