中文

循环无模型强化学习可作为许多部分可观测马尔可夫决策过程的强基线

机器学习 2022-06-07 v3 人工智能 机器人学

摘要

强化学习中的许多问题,如元强化学习、鲁棒强化学习、强化学习中的泛化以及时间信用分配,都可以归结为部分可观测马尔可夫决策过程(POMDP)。理论上,仅通过将无模型强化学习与基于记忆的架构(如循环神经网络)相结合,就提供了一种解决所有类型POMDP的通用方法。然而,先前的工作发现,这种循环无模型强化学习方法往往比专门为特定类型POMDP设计的更专门的算法表现更差。本文重新审视了这一说法。我们发现,仔细的架构和超参数决策通常可以产生一个循环无模型实现,其性能与更复杂的最新技术相当(有时甚至显著更好)。我们与来自6种先前专门方法的21个环境进行了比较,发现我们的实现在18/21个环境中实现了更高的样本效率和渐近性能。我们还发布了一个简单高效的循环无模型强化学习实现,供未来工作用作POMDP的基线。

关键词

引用

@article{arxiv.2110.05038,
  title  = {Recurrent Model-Free RL Can Be a Strong Baseline for Many POMDPs},
  author = {Tianwei Ni and Benjamin Eysenbach and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:2110.05038},
  year   = {2022}
}

备注

ICML 2022 camera ready version. Code: https://github.com/twni2016/pomdp-baselines Project site: https://sites.google.com/view/pomdp-baselines