中文

上下文感知主动多步强化学习

机器学习 2019-11-28 v2 人工智能 机器学习

摘要

强化学习近来备受关注,尤其是策略梯度算法,已在具有挑战性的决策与控制任务中展现出成效。本文提出一种具有自适应步长的主动多步 TD 算法来学习 actor 与 critic。具体而言,我们的模型由两部分组成:主动步长学习与自适应多步 TD 算法。首先,我们将时间范围划分为块,并在每个块内主动选择状态与动作。然后给定所选样本,我们提出自适应多步 TD,其推广了 TD(λ\lambda),但自适应地开启/关闭来自不同步未来回报的备份。特别地,自适应多步 TD 引入了上下文感知机制,此处为一个二分类器,其基于上下文变化决定是否开启未来备份。因此,我们的模型可视为主动学习与多步 TD 算法的结合,能够在不需重要性采样的情况下进行离屏策略学习。我们在离散与连续空间任务上分别以离屏策略设置评估了该方法,并展示了与其他强化学习基线相比具有竞争力的结果。

关键词

引用

@article{arxiv.1911.04107,
  title  = {Context-aware Active Multi-Step Reinforcement Learning},
  author = {Gang Chen and Dingcheng Li and Ran Xu},
  journal= {arXiv preprint arXiv:1911.04107},
  year   = {2019}
}

备注

9 pages