基于类示范采样探索的机器人深度强化学习策略内 Actor-Critic 网络高效训练
机器学习
2021-09-28 v1 人机交互
机器人学
系统与控制
系统与控制
摘要
在高维复杂环境中,从零开始训练强化学习(RL)模型常受困于冗长繁琐的智能体—环境交互收集过程。相反,利用专家示范引导 RL 智能体可提升样本效率并改善最终收敛性。为更好地将专家先验与策略内 RL 模型结合,我们提出一种基于 actor-critic 算法的示范学习(LfD)通用框架。技术上,我们首先采用 K-Means 聚类评估采样探索与示范数据的相似度,随后通过修改梯度更新策略以增加相似帧中动作的可能性来利用示范。我们在 Mujoco 的 4 个标准基准环境及 2 个自建机器人环境中开展实验。结果表明,在特定条件下,我们的算法可将样本效率提升 20% ~ 40%。通过将我们的框架与策略内算法结合,RL 模型可加速收敛并在交互代价高昂的复杂机器人场景中取得更好的最终平均回合奖励。
关键词
引用
@article{arxiv.2109.13005,
title = {Efficiently Training On-Policy Actor-Critic Networks in Robotic Deep Reinforcement Learning with Demonstration-like Sampled Exploration},
author = {Zhaorun Chen and Binhao Chen and Shenghan Xie and Liang Gong and Chengliang Liu and Zhengfeng Zhang and Junping Zhang},
journal= {arXiv preprint arXiv:2109.13005},
year = {2021}
}
备注
This paper is accepted at The 3rd International Symposium on Robotics & Intelligent Manufacturing Technology (ISRIMT 2021) (https://conferences.ieee.org/conferences_events/conferences/conferencedetails/53730) and nominated as the "best paper"