深度强化学习中被动学习的困难
机器学习
2021-10-28 v1 人工智能
摘要
从观测数据而非主动与环境交互来学习行动,是强化学习(RL)中众所周知的挑战。近期方法对所学策略施加约束或进行保守更新,以防止与数据集的状态-动作分布发生强烈偏离。尽管这些方法使用非线性函数逼近进行评估,其理论依据大多局限于表格或线性情形。鉴于深度强化学习令人瞩目的成果,我们认为有必要更清晰地理解此设定下的挑战。秉承 Held 与 Hein 1963 年经典实验的思路,我们提出“串联学习”实验范式,以助于我们对离线强化学习困难的实证分析。我们确定函数逼近与固定数据分布的结合是最强的影响因素,从而扩展但也挑战了既往工作所提出的假设。我们的结果为离线深度强化学习提供了相关洞见,同时也为在线控制学习中所观察到的现象带来新的认识。
引用
@article{arxiv.2110.14020,
title = {The Difficulty of Passive Learning in Deep Reinforcement Learning},
author = {Georg Ostrovski and Pablo Samuel Castro and Will Dabney},
journal= {arXiv preprint arXiv:2110.14020},
year = {2021}
}
备注
Accepted paper at NeurIPS 2021