ViNT:一种用于视觉导航的基础模型
机器人学
2023-10-25 v2 计算机视觉与模式识别
机器学习
摘要
通用预训练模型(“基础模型”)使从业者能够利用比从头学习所需少得多的数据集,为单个机器学习问题生成可泛化的解决方案。此类模型通常在大型且多样的数据集上以弱监督方式训练,消耗的训练数据远多于任何单个下游应用所能提供的。在本文中,我们描述了视觉导航Transformer(ViNT),这是一种旨在将通用预训练模型的成功引入基于视觉的机器人导航的基础模型。ViNT以通用的目标到达目标进行训练,可配合任意导航数据集使用,并采用灵活的基于Transformer的架构来学习导航可供性,并实现对多种下游导航任务的高效适配。ViNT在多个现有导航数据集上训练,包含来自不同机器人平台的数百小时机器人导航数据,并展现出正向迁移,优于在单一数据集上训练的专业模型。ViNT可结合基于扩散的子目标提议来探索新环境,并在配备远程启发式方法时解决公里级导航问题。ViNT还可通过受提示微调启发的技术适配到新颖任务规范,即用另一任务模态(例如GPS航点或路由命令)的编码替换目标编码器,并嵌入到相同的目标令牌空间中。这种灵活性以及适应多种下游问题域的能力,确立了ViNT作为移动机器人学有效基础模型的地位。有关视频、代码和模型检查点,请参见我们的项目页面:https://visualnav-transformer.github.io。
引用
@article{arxiv.2306.14846,
title = {ViNT: A Foundation Model for Visual Navigation},
author = {Dhruv Shah and Ajay Sridhar and Nitish Dashora and Kyle Stachowicz and Kevin Black and Noriaki Hirose and Sergey Levine},
journal= {arXiv preprint arXiv:2306.14846},
year = {2023}
}
备注
Accepted for oral presentation at CoRL 2023