中文

时序偏移强化学习

机器学习 2021-10-28 v3

摘要

传统基于图像的深度强化学习(DRL)算法所采用的函数逼近器通常缺乏时序学习组件,而是侧重于学习空间组件。我们提出一种技术——时序偏移强化学习(TSRL),其中时序与空间组件被联合学习。此外,TSRL 不需要额外参数来进行时序学习。我们表明,在我们测试的两个 Atari 环境中,TSRL 均优于常用的帧堆叠启发式方法,并在其中一个上击败了 SOTA。该研具有在机器人以及序贯决策领域的意义。

关键词

引用

@article{arxiv.2109.02145,
  title  = {Temporal Shift Reinforcement Learning},
  author = {Deepak George Thomas and Tichakorn Wongpiromsarn and Ali Jannesari},
  journal= {arXiv preprint arXiv:2109.02145},
  year   = {2021}
}