中文

面向在线深度强化学习的自适应多时间尺度资格迹

机器人学 2022-01-26 v2 机器学习

摘要

深度强化学习 (DRL) 是教机器人执行复杂任务的一种有前景的方法。由于直接复用存储经验数据的方法无法跟随时变环境机器人问题中环境的变化,因此需要在线 DRL。资格迹方法作为传统强化学习(使用线性回归器而非 DRL)中提升样本效率的在线学习技术而广为人知。深度神经网络参数间的依赖性会破坏资格迹,这正是其未被集成进 DRL 的原因。尽管用最具影响力的梯度替换而非像资格迹那样累积梯度可缓解该问题,但替换操作减少了先前经验的复用次数。为解决这些问题,本研究提出一种即便在 DRL 中也能使用且保持高样本效率的新资格迹方法。当累积梯度与用最新参数计算的梯度不一致时,所提方法考虑过去与最新参数间的发散度,以自适应衰减资格迹。由于过去与最新参数间发散度的计算代价不可行,故利用二者输出间的 Bregman 散度。此外,首次设计了具有多时间尺度迹的通用方法。该设计允许替换最具影响力的自适应累积(衰减)资格迹。

关键词

引用

@article{arxiv.2008.10040,
  title  = {Adaptive and Multiple Time-scale Eligibility Traces for Online Deep Reinforcement Learning},
  author = {Taisuke Kobayashi},
  journal= {arXiv preprint arXiv:2008.10040},
  year   = {2022}
}

备注

13 pages, 13 figures