无模型与基于模型的离线强化学习算法比较
机器学习
2022-01-17 v1
摘要
离线强化学习(RL)算法通常针对 MuJoCo 等环境设计,其中规划视界极长且不存在噪声。我们在多个工业基准(IB)数据集上比较了无模型、基于模型以及混合离线 RL 方法,以在更接近实际问题的设定(包括复杂噪声和部分可观测状态)下测试这些算法。我们发现在 IB 上混合方法面临严重困难,而更简单的算法,例如基于 rollout 的算法或带有更简单正则化项的无模型算法,在数据集上表现最佳。
引用
@article{arxiv.2201.05433,
title = {Comparing Model-free and Model-based Algorithms for Offline Reinforcement Learning},
author = {Phillip Swazinna and Steffen Udluft and Daniel Hein and Thomas Runkler},
journal= {arXiv preprint arXiv:2201.05433},
year = {2022}
}
备注
Submitted to IFAC Conference on Intelligent Control and Automation Sciences (ICONS)2022