基于事后经验回放与Shapley加性解释解释的机械臂杠杆操控
机器人学
2021-10-08 v1 机器学习
摘要
本文研究利用可解释深度强化学习进行机械臂杠杆控制。首先,我们使用深度确定性策略梯度算法与事后经验回放(Hindsight Experience Replay)技术训练策略,目标为控制机械臂操控杠杆。这使我们既能使用连续状态与动作,又能从稀疏奖励中学习。能从稀疏奖励学习对深度强化学习尤为可取,因为为此类复杂任务设计奖励函数颇具挑战。我们先在PyBullet模拟器中训练以加速过程,但该模拟器在此任务上不如真实环境精确。完成PyBullet训练后,我们在Gazebo模拟器中进一步训练,其运行慢于PyBullet但在此任务上更精确。随后我们将策略迁移至真实环境,在大多数回合中取得与模拟环境相当的性能。为解释策略决策,我们使用SHAP方法基于真实环境回合建立解释模型。这给出了一些符合直觉与一些不符的结果。我们还质疑:当近似SHAP值所作的独立假设,对于此类状态间存在相关性的系统,是否影响这些值的准确性。
引用
@article{arxiv.2110.03292,
title = {Robotic Lever Manipulation using Hindsight Experience Replay and Shapley Additive Explanations},
author = {Sindre Benjamin Remman and Anastasios M. Lekkas},
journal= {arXiv preprint arXiv:2110.03292},
year = {2021}
}
备注
Published in proceedings of the European Control Conference 2021