中文

基于探索高效深度强化学习的先验示范机器人任务求解

机器人学 2026-01-09 v2 机器学习

摘要

本文提出了一种面向包含示范的机器人任务的探索高效深度强化学习(DRLR)框架。该DRLR框架基于名为Imitation Bootstrapped Reinforcement Learning(IBRL)的算法进行开发。我们通过修改动作选择模块来改进IBRL。 proposed的动作选择模块提供了校准后的Q值,从而缓解了导致探索低效的自助错误。此外,为防止RL策略收敛至次优策略,我们改用SAC作为RL策略而非TD3。通过在两个机器人任务上学习——桶装货和打开抽屉——我们在实验上验证了该方法在缓解自助误差和防止过拟合方面的有效性。仿真结果还表明,DRLR框架在状态-动作维度高低且示范质量不同的任务中都表现出稳健性。为评估开发的框架在真实世界工业机器人任务中的性能,我们将桶装货任务部署在真实轮式装载机上。仿真到现实的结果验证了DRLR框架成功部署的能力。

关键词

引用

@article{arxiv.2509.04069,
  title  = {Solving Robotics Tasks with Prior Demonstration via Exploration-Efficient Deep Reinforcement Learning},
  author = {Chengyandan Shen and Christoffer Sloth},
  journal= {arXiv preprint arXiv:2509.04069},
  year   = {2026}
}

备注

This paper has been accepted for Journal publication in Frontiers in Robotics and AI