通过自动规划引导强化学习中的机器人探索
机器人学
2021-03-17 v2 机器学习
摘要
强化学习(RL)使智能体能够从试错经验中学习以实现长期目标;自动规划旨在利用动作知识计算完成任务的计划。尽管二者有着完成复杂任务的共同目标,但由于计算模态不同,RL与自动规划的发展在很大程度上相互隔离。着眼于提升RL智能体的学习效率,我们开发了引导式Dyna-Q(GDQ),使RL智能体能够利用动作知识进行推理,从而避免探索关联度较低的状态。该动作知识用于从乐观仿真中生成人工经验。GDQ已在仿真中以及使用移动机器人在多房间办公环境中执行导航任务得到评估。与竞争性基线相比,GDQ显著减少了探索代价,同时提升了所学策略的质量。
引用
@article{arxiv.2004.11456,
title = {Guiding Robot Exploration in Reinforcement Learning via Automated Planning},
author = {Yohei Hayamizu and Saeid Amiri and Kishan Chandan and Keiki Takadama and Shiqi Zhang},
journal= {arXiv preprint arXiv:2004.11456},
year = {2021}
}
备注
Accepted in International Conference of Planning and Scheduling (ICAPS-21)