中文

蒸馏强化学习策略以实现可解释的机器人运动:梯度提升机与符号回归

机器人学 2024-03-22 v1 人工智能 机器学习

摘要

强化学习(RL)的最新进展在机器人运动能力方面取得了显著成就。然而,基于神经网络的RL策略的复杂性和“黑箱”特性阻碍了其可解释性和更广泛的接受度,尤其是在要求高安全性和可靠性的应用中。本文介绍了一种新颖的方法,使用梯度提升机(GBMs)、可解释提升机(EBMs)和符号回归,将神经RL策略蒸馏为更可解释的形式。通过利用广义加性模型、决策树和解析表达式的固有可解释性,我们将不透明的神经网络策略转化为更透明的“玻璃箱”模型。我们使用RL训练专家神经网络策略,随后将其蒸馏为(i)GBMs、(ii)EBMs和(iii)符号策略。为了解决行为克隆中固有的分布偏移挑战,我们提出使用数据集聚合(DAgger)算法,并采用专家策略与蒸馏策略之间按回合依赖的动作交替课程,以实现反馈控制策略的高效蒸馏。我们在各种机器人运动步态——行走、小跑、跳跃和溜蹄——上评估了我们的方法,并使用多种方法研究了蒸馏策略中不同观测对关节动作的重要性。我们为神经专家策略训练了205小时的模拟经验,并使用所提出的方法,每种步态仅用10分钟的模拟交互就蒸馏出可解释的策略。

关键词

引用

@article{arxiv.2403.14328,
  title  = {Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression},
  author = {Fernando Acero and Zhibin Li},
  journal= {arXiv preprint arXiv:2403.14328},
  year   = {2024}
}