中文

利用跨模态 Transformer 端到端学习视觉引导的四足运动

机器学习 2022-05-27 v3 计算机视觉与模式识别 机器人学

摘要

我们提出使用基于 Transformer 的模型结合强化学习 (RL) 来解决四足运动任务,该模型学习融合本体感知信息和高维深度传感器输入。尽管基于学习的运动控制借助 RL 已取得巨大进展,大多数方法仍依赖域随机化来训练在挑战性地形上泛化的盲代理。我们的核心见解是,本体感知状态仅提供用于即时反应的接触测量,而配备视觉感官观测的代理可通过提前多步预测环境变化,学习主动操控含障碍和不平坦地形的环境。在本文中,我们介绍 LocoTransformer,一种端到端 RL 方法,利用本体感知状态和视觉观测进行运动控制。我们在具有不同障碍和不平坦地形的挑战性仿真环境中评估了我们的方法。我们通过将学到的策略在室内及野外带有未见障碍和地形的真实机器人上运行,将其从仿真迁移到真实机器人。我们的方法不仅显著优于基线,而且实现了远更好的泛化性能,尤其在迁移到真实机器人时。我们的项目页面及视频位于 https://rchalyang.github.io/LocoTransformer/ 。

关键词

引用

@article{arxiv.2107.03996,
  title  = {Learning Vision-Guided Quadrupedal Locomotion End-to-End with Cross-Modal Transformers},
  author = {Ruihan Yang and Minghao Zhang and Nicklas Hansen and Huazhe Xu and Xiaolong Wang},
  journal= {arXiv preprint arXiv:2107.03996},
  year   = {2022}
}

备注

Our project page with videos is at https://RchalYang.github.io/LocoTransformer