基于自监督预训练视觉 Transformer 的单目机器人导航
机器人学
2022-05-03 v2 人工智能
计算机视觉与模式识别
摘要
本工作中,我们考虑利用少量标注图像学习单目机器人导航感知模型的问题。使用以无标签自监督方法预训练的 Vision Transformer (ViT),我们仅用 70 张训练图像便成功为 Duckietown 环境训练了一个粗粒度图像分割模型。我们的模型在 8x8 图像块级别执行粗粒度图像分割,且推理分辨率可调整以平衡预测粒度与实时感知约束。我们研究了如何最好地将 ViT 适配于我们的任务与环境,发现一些轻量架构即使在 CPU 上也能以可用帧率产生良好的单图像分割。所得感知模型被用作一个简单而鲁棒的视觉伺服智能体的骨干,我们将其部署在一台差速驱动移动机器人上执行两项任务:车道跟随与障碍物规避。
引用
@article{arxiv.2203.03682,
title = {Monocular Robot Navigation with Self-Supervised Pretrained Vision Transformers},
author = {Miguel Saavedra-Ruiz and Sacha Morin and Liam Paull},
journal= {arXiv preprint arXiv:2203.03682},
year = {2022}
}
备注
In proceeding of the 19th Conference on Robots and Vision (CRV), 2022, Toronto, Ontario, Canada