中文

基于非参数值近似的从像素中快速且数据高效的强化学习

机器学习 2022-03-08 v1 人工智能

摘要

我们提出迹间回报的非参数近似(NAIT),一种用于离散动作、基于像素环境的强化学习算法,该算法兼具极高的样本效率与计算效率。NAIT是一种懒惰学习方法,其更新等价于回合完成时的情景蒙特卡洛,但允许在回合进行中稳定地纳入奖励。我们利用固定的领域无关表示、基于简单距离的探索以及基于邻近图的查找来实现极快的执行速度。我们在ATARI100k的26和57个游戏变体上对NAIT进行了经验评估,尽管其简单,它在在线设定中取得了具有竞争力的性能,且挂钟时间加速超过100倍。

关键词

引用

@article{arxiv.2203.03078,
  title  = {Fast and Data Efficient Reinforcement Learning from Pixels via Non-Parametric Value Approximation},
  author = {Alexander Long and Alan Blair and Herke van Hoof},
  journal= {arXiv preprint arXiv:2203.03078},
  year   = {2022}
}

备注

AAAI2022