中文

基于对称性引导示范的采样高效强化学习用于机器人操作

机器人学 2025-09-23 v2 人工智能

摘要

强化学习(RL)存在采样效率低的问题,尤其在复杂机器人操作任务的高维连续状态-动作空间中。即便示范数据有限且采集自简化环境,利用先验知识仍可提升 RL 性能。为此,我们定义了通用抽象对称性(GAS),用于聚合来自机器人环境对称抽象分区的示范数据。我们提出 Demo-EASE,一种采用双缓冲架构存储示范数据与 RL 生成经验的新型训练框架。Demo-EASE 通过对称性引导示范和行为克隆提升采样效率,实现强初始化与平衡的探索-利用。Demo-EASE 兼容同策略和异策略 RL 算法,支持多种训练机制。我们在 PyBullet 中使用 Kinova Gen3 机器人进行关节空间控制的三个仿真实验中评估了我们的框架。结果表明,与标准 RL 基线相比,Demo-EASE 显著加速收敛并提升最终性能,展现了其在高效真实世界机器人操作学习中的潜力。

关键词

引用

@article{arxiv.2304.06055,
  title  = {Sample-Efficient Reinforcement Learning with Symmetry-Guided Demonstrations for Robotic Manipulation},
  author = {Amir M. Soufi Enayati and Zengjie Zhang and Kashish Gupta and Homayoun Najjaran},
  journal= {arXiv preprint arXiv:2304.06055},
  year   = {2025}
}