一种极简的离线强化学习方法
机器学习
2021-12-06 v2 人工智能
机器学习
摘要
离线强化学习(RL)定义了从固定批次数据中学习的任务。由于分布外动作在价值估计中的误差,大多数离线 RL 算法采取以数据集中所含动作约束或正则化策略的方法。构建于已有 RL 算法之上,为使 RL 算法离线工作而做的修改以额外复杂性为代价。离线 RL 算法引入了新的超参数,并经常利用如生成模型等辅助组件,同时调整底层 RL 算法。在本文中,我们旨在使深度 RL 算法工作而进行最小改动。我们发现,只需向在线 RL 算法的策略更新中添加一个行为克隆项并对数据归一化,即可匹配最先进离线 RL 算法的性能。所得算法是一个易于实现和调参的基线,同时通过去除先前方法的额外计算开销,将总体运行时间减少一半以上。
引用
@article{arxiv.2106.06860,
title = {A Minimalist Approach to Offline Reinforcement Learning},
author = {Scott Fujimoto and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2106.06860},
year = {2021}
}
备注
NeurIPS 2021 Spotlight