中文

基于自监督预训练视觉 Transformer 的单目机器人导航

机器人学 2022-05-03 v2 人工智能 计算机视觉与模式识别

摘要

本工作中,我们考虑利用少量标注图像学习单目机器人导航感知模型的问题。使用以无标签自监督方法预训练的 Vision Transformer (ViT),我们仅用 70 张训练图像便成功为 Duckietown 环境训练了一个粗粒度图像分割模型。我们的模型在 8x8 图像块级别执行粗粒度图像分割,且推理分辨率可调整以平衡预测粒度与实时感知约束。我们研究了如何最好地将 ViT 适配于我们的任务与环境,发现一些轻量架构即使在 CPU 上也能以可用帧率产生良好的单图像分割。所得感知模型被用作一个简单而鲁棒的视觉伺服智能体的骨干,我们将其部署在一台差速驱动移动机器人上执行两项任务:车道跟随与障碍物规避。

关键词

引用

@article{arxiv.2203.03682,
  title  = {Monocular Robot Navigation with Self-Supervised Pretrained Vision Transformers},
  author = {Miguel Saavedra-Ruiz and Sacha Morin and Liam Paull},
  journal= {arXiv preprint arXiv:2203.03682},
  year   = {2022}
}

备注

In proceeding of the 19th Conference on Robots and Vision (CRV), 2022, Toronto, Ontario, Canada