中文

基于稀少示范的图像式抓取离线到在线强化学习

机器人学 2025-01-24 v2 人工智能 机器学习

摘要

离线到在线强化学习(Offline-to-online reinforcement learning, O2O RL)旨在与环境交互的同时获取不断改进的策略,同时确保初始策略的行为满足要求。这种满足要求的行为对机器人操作至关重要,因为随机探索可能因灾难性失败和时间成本而昂贵。当仅能获得少量(可能次优)示范时,O2O RL尤为引人注目,而这种情况下,行为模仿(behavioral cloning, BC)因分布迁移问题而常常失败。本文提出了一种新型O2O RL算法,可在仅凭少量人类示范(50个)即可实现的机器人真实图像式真空抓取任务中学习,BC及现有常用RL算法大多无法达到类似性能。该算法将off-policy actor-critic算法中的目标网络替换为受神经切向核启发的正则化技术。实验表明,所提算法可在不到两小时的交互时间内实现超过90%的成功率,而BC及现有RL算法均未能达到相似水平。

关键词

引用

@article{arxiv.2410.14957,
  title  = {Offline-to-online Reinforcement Learning for Image-based Grasping with Scarce Demonstrations},
  author = {Bryan Chan and Anson Leung and James Bergstra},
  journal= {arXiv preprint arXiv:2410.14957},
  year   = {2025}
}

备注

In CoRL Workshop on Mastering Robot Manipulation in a World of Abundant Data 2024