混合可观测性下的分层强化学习
机器人学
2022-06-07 v3
摘要
混合可观测马尔可夫决策过程(MOMDP)框架建模了许多机器人领域,其中部分状态变量完全可观测而其余不可观测。本工作中,我们依据动作如何影响状态中完全可观测分量、以及这些分量如何影响部分可观测分量与奖励,界定了 MOMDP 的一个重要子类。这一独特性质允许一种我们称为混合可观测性下分层强化学习(HILMO)的两层分层方法,其将部分可观测性限制在顶层,而底层保持完全可观测,从而实现更高的学习效率。顶层生成由底层达成的期望目标,直至任务解决。我们进一步给出理论保证,表明在温和假设下我们的方法可实现最优与准最优行为。在长视野连续控制任务上的实证结果显示了我们的方法在成功率、样本效率与挂钟训练时间方面的有效性与高效性。我们还将仿真中学得的策略部署于真实机器人上。
引用
@article{arxiv.2204.00898,
title = {Hierarchical Reinforcement Learning under Mixed Observability},
author = {Hai Nguyen and Zhihan Yang and Andrea Baisero and Xiao Ma and Robert Platt and Christopher Amato},
journal= {arXiv preprint arXiv:2204.00898},
year = {2022}
}
备注
Accepted at the 15th International Workshop on the Algorithmic Foundations of Robotics (WAFR) 2022, University of Maryland, College Park. The first two authors contributed equally