中文

无模型与基于模型的离线强化学习算法比较

机器学习 2022-01-17 v1

摘要

离线强化学习(RL)算法通常针对 MuJoCo 等环境设计,其中规划视界极长且不存在噪声。我们在多个工业基准(IB)数据集上比较了无模型、基于模型以及混合离线 RL 方法,以在更接近实际问题的设定(包括复杂噪声和部分可观测状态)下测试这些算法。我们发现在 IB 上混合方法面临严重困难,而更简单的算法,例如基于 rollout 的算法或带有更简单正则化项的无模型算法,在数据集上表现最佳。

关键词

引用

@article{arxiv.2201.05433,
  title  = {Comparing Model-free and Model-based Algorithms for Offline Reinforcement Learning},
  author = {Phillip Swazinna and Steffen Udluft and Daniel Hein and Thomas Runkler},
  journal= {arXiv preprint arXiv:2201.05433},
  year   = {2022}
}

备注

Submitted to IFAC Conference on Intelligent Control and Automation Sciences (ICONS)2022