基于非参数值近似的从像素中快速且数据高效的强化学习
机器学习
2022-03-08 v1 人工智能
摘要
我们提出迹间回报的非参数近似(NAIT),一种用于离散动作、基于像素环境的强化学习算法,该算法兼具极高的样本效率与计算效率。NAIT是一种懒惰学习方法,其更新等价于回合完成时的情景蒙特卡洛,但允许在回合进行中稳定地纳入奖励。我们利用固定的领域无关表示、基于简单距离的探索以及基于邻近图的查找来实现极快的执行速度。我们在ATARI100k的26和57个游戏变体上对NAIT进行了经验评估,尽管其简单,它在在线设定中取得了具有竞争力的性能,且挂钟时间加速超过100倍。
引用
@article{arxiv.2203.03078,
title = {Fast and Data Efficient Reinforcement Learning from Pixels via Non-Parametric Value Approximation},
author = {Alexander Long and Alan Blair and Herke van Hoof},
journal= {arXiv preprint arXiv:2203.03078},
year = {2022}
}
备注
AAAI2022