MSVIPER:基于强化学习的机器人导航中改进的策略蒸馏方法
机器人学
2022-09-20 v1 人工智能
人机交互
机器学习
摘要
我们提出多重场景可验证强化学习 via 策略提取(MSVIPER),一种用于决策树策略蒸馏以改进机器人导航的新方法。MSVIPER 使用任意涉及学习状态-动作映射的强化学习(RL)技术学习“专家”策略,然后利用模仿学习从中学习决策树策略。我们证明 MSVIPER 可生成高效的决策树,并能准确模仿专家策略的行为。此外,我们提出高效的策略蒸馏与树修改技术,利用决策树结构以无需重新训练即可改进策略。我们将该方法用于改进室内与室外场景下基于 RL 的机器人导航算法。我们展示了其益处:在动态障碍物间导航的移动机器人中冻结与振荡行为减少(最高降低 95%),以及在复杂不平地形上的室外机器人导航中振动与振荡减少(最高降低 17%)。
引用
@article{arxiv.2209.09079,
title = {MSVIPER: Improved Policy Distillation for Reinforcement-Learning-Based Robot Navigation},
author = {Aaron M. Roth and Jing Liang and Ram Sriram and Elham Tabassi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2209.09079},
year = {2022}
}
备注
6 pages main paper, 2 pages of references, 5 page appendix (13 pages total) 5 tables, 9 algorithms, 4 figures