中文

基于高斯过程的多保真度强化学习

机器人学 2020-03-10 v2

摘要

我们研究如何使用尽可能少的真实世界样本进行强化学习(RL)。在大型连续状态空间中,直接应用 RL 可能效率低下。我们提出了多保真度强化学习(MFRL)的两种版本——基于模型与无模型,它们利用高斯过程(GPs)在真实环境中学习最优策略。在 MFRL 框架中,智能体使用真实环境的多个模拟器来执行动作。随着模拟器链的保真度递增,在 successively 更高保真度模拟器中使用的样本数量可以减少。通过将 GPs 引入 MFRL 框架,我们经实验观察到基于模型的 RL 样本数减少多达 40%40\%,无模型版本减少多达 60%60\%。我们通过仿真以及地面机器人导航的真实世界实验检验了算法的性能。

关键词

引用

@article{arxiv.1712.06489,
  title  = {Multi-Fidelity Reinforcement Learning with Gaussian Processes},
  author = {Varun Suryan and Nahush Gondhalekar and Pratap Tokekar},
  journal= {arXiv preprint arXiv:1712.06489},
  year   = {2020}
}