中文

MSVIPER:基于强化学习的机器人导航中改进的策略蒸馏方法

机器人学 2022-09-20 v1 人工智能 人机交互 机器学习

摘要

我们提出多重场景可验证强化学习 via 策略提取(MSVIPER),一种用于决策树策略蒸馏以改进机器人导航的新方法。MSVIPER 使用任意涉及学习状态-动作映射的强化学习(RL)技术学习“专家”策略,然后利用模仿学习从中学习决策树策略。我们证明 MSVIPER 可生成高效的决策树,并能准确模仿专家策略的行为。此外,我们提出高效的策略蒸馏与树修改技术,利用决策树结构以无需重新训练即可改进策略。我们将该方法用于改进室内与室外场景下基于 RL 的机器人导航算法。我们展示了其益处:在动态障碍物间导航的移动机器人中冻结与振荡行为减少(最高降低 95%),以及在复杂不平地形上的室外机器人导航中振动与振荡减少(最高降低 17%)。

关键词

引用

@article{arxiv.2209.09079,
  title  = {MSVIPER: Improved Policy Distillation for Reinforcement-Learning-Based Robot Navigation},
  author = {Aaron M. Roth and Jing Liang and Ram Sriram and Elham Tabassi and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2209.09079},
  year   = {2022}
}

备注

6 pages main paper, 2 pages of references, 5 page appendix (13 pages total) 5 tables, 9 algorithms, 4 figures