通过局部规划实现样本高效的深度强化学习
机器学习
2023-07-04 v2 人工智能
摘要
本工作的关注点是在具备模拟器的条件下实现样本高效的深度强化学习(RL)。模拟器的一个有用特性是通常易于将环境重置到先前观测到的状态。我们提出一个名为不确定性优先局部规划(UFLP)的算法框架,利用了这一特性。具体而言,在每次数据收集迭代中,以一定概率,我们的元算法将环境重置到一个具有高不确定性的已观测状态,而非按照初始状态分布采样。随后智能体-环境交互如同标准在线RL设定中进行。我们证明,这一简单过程能显著改善若干基线RL算法在困难探索任务上的样本代价。值得注意的是,借助我们的框架,仅用简单的(分布)双DQN即可在声名狼藉的难解Atari游戏Montezuma's Revenge上取得超人类表现。我们的工作可视为对已有具理论保证算法的一种高效近似实现,这为积极的实证结果提供了一种解释。
引用
@article{arxiv.2301.12579,
title = {Sample Efficient Deep Reinforcement Learning via Local Planning},
author = {Dong Yin and Sridhar Thiagarajan and Nevena Lazic and Nived Rajaraman and Botao Hao and Csaba Szepesvari},
journal= {arXiv preprint arXiv:2301.12579},
year = {2023}
}
备注
25 pages, 11 figures