中文

MResT:利用视觉-语言模型实现实时控制的多分辨率感知

机器人学 2024-01-29 v1 计算机视觉与模式识别 机器学习

摘要

利用跨不同空间和时间分辨率的感知模态可以提升机器人操作任务的性能。多空间分辨率感知提供在不同空间尺度上捕获的层次化信息,并支持粗略和精确运动。同时,多时间分辨率感知使智能体能够表现出高反应性和实时控制能力。在这项工作中,我们提出了一个框架 MResT(多分辨率 Transformer),用于学习可泛化的、以语言为条件的多任务策略,该策略利用不同容量的网络在不同空间和时间分辨率下进行感知,以有效执行精确和反应性任务的实时控制。我们利用现成的预训练视觉-语言模型处理低频全局特征,同时使用小型非预训练模型来适应高频局部反馈。通过在 3 个领域(粗略、精确和动态操作任务)的广泛实验,我们表明我们的方法相比近期的多任务基线有显著提升(平均 2 倍)。此外,我们的方法能很好地泛化到目标物体的视觉和几何变化以及变化的交互力。

关键词

引用

@article{arxiv.2401.14502,
  title  = {MResT: Multi-Resolution Sensing for Real-Time Control with Vision-Language Models},
  author = {Saumya Saxena and Mohit Sharma and Oliver Kroemer},
  journal= {arXiv preprint arXiv:2401.14502},
  year   = {2024}
}

备注

CoRL'23, Project website: http://tinyurl.com/multi-res-realtime-control