中文

基于模型预测强化学习的动态非抓取物体运输

机器人学 2024-12-03 v1 机器学习

摘要

我们研究了如何从有限的真实世界演示中教会机器人操作机械臂执行动态非抓取物体运输(亦称“机器人服务生”任务)。我们提出一种结合批量强化学习(RL)与模型预测控制(MPC)的方法,通过从演示数据预训练多个价值函数,并在不确定性感知的 MPC 框架内联合使用,以应对数据覆盖范围有限带来的鲁棒性问题。该方法易于集成到现有的即插即用 MPC 框架中,使我们能够仅依据任务空间演示进行学习,稀疏标注的状态转移仍能利用 MPC 确保平滑的关节空间运动并满足约束条件。我们通过在 Franka Panda 机器人上进行大量仿真与实际实验验证了所提方法的可行性,展示了仅凭 50-100 个演示即可稳健部署所学价值函数。此外,该方法能够对训练期间未见过的新颖物体进行泛化,并能改进次优演示。我们相信,这一框架能够减少大量演示的负担,促进机器人操作机械臟学习执行非抓取操作任务的快速部署。项目视频及补充材料可在 https://sites.google.com/view/cvmpc 查阅。

关键词

引用

@article{arxiv.2412.00086,
  title  = {Dynamic Non-Prehensile Object Transport via Model-Predictive Reinforcement Learning},
  author = {Neel Jawale and Byron Boots and Balakumar Sundaralingam and Mohak Bhardwaj},
  journal= {arXiv preprint arXiv:2412.00086},
  year   = {2024}
}

备注

11 pages