中文

基于视觉运动学链预测的操作学习扩放

机器人学 2024-10-15 v3 人工智能

摘要

从多样化数据集中学习通用模型在机器学习中取得了巨大成功。然而在机器人领域,现有方法在多任务学习中通常受限于单一机器人和工作空间,而近期工作如 RT-X 需要非平凡的 action 正规化程序来手动桥接不同环境中不同动作空间的差距。本文提出了视觉运动学链作为一种精确且通用的 quasi-static 动作表示,用于机器人学习中的多环境覆盖,无需手动调整,因为视觉运动学链可自动从机器人模型和相机参数中获取。我们提出了 Visual Kinematics Transformer(VKT),一个无卷积结构的架构,支持任意数量的相机视角,通过 optimal point-set matching 进行运动学结构预测。我们在 Calvin、RLBench、Open-X 和实际机器人操作任务上证明了 VKT 在 BC transformers 之上的优越性能。视频演示可在 https://mlzxy.github.io/visual-kinetic-chain 查看。

关键词

引用

@article{arxiv.2406.07837,
  title  = {Scaling Manipulation Learning with Visual Kinematic Chain Prediction},
  author = {Xinyu Zhang and Yuhan Liu and Haonan Chang and Abdeslam Boularias},
  journal= {arXiv preprint arXiv:2406.07837},
  year   = {2024}
}

备注

CoRL 2024