上下文感知主动多步强化学习
机器学习
2019-11-28 v2 人工智能
机器学习
摘要
强化学习近来备受关注,尤其是策略梯度算法,已在具有挑战性的决策与控制任务中展现出成效。本文提出一种具有自适应步长的主动多步 TD 算法来学习 actor 与 critic。具体而言,我们的模型由两部分组成:主动步长学习与自适应多步 TD 算法。首先,我们将时间范围划分为块,并在每个块内主动选择状态与动作。然后给定所选样本,我们提出自适应多步 TD,其推广了 TD(),但自适应地开启/关闭来自不同步未来回报的备份。特别地,自适应多步 TD 引入了上下文感知机制,此处为一个二分类器,其基于上下文变化决定是否开启未来备份。因此,我们的模型可视为主动学习与多步 TD 算法的结合,能够在不需重要性采样的情况下进行离屏策略学习。我们在离散与连续空间任务上分别以离屏策略设置评估了该方法,并展示了与其他强化学习基线相比具有竞争力的结果。
引用
@article{arxiv.1911.04107,
title = {Context-aware Active Multi-Step Reinforcement Learning},
author = {Gang Chen and Dingcheng Li and Ran Xu},
journal= {arXiv preprint arXiv:1911.04107},
year = {2019}
}
备注
9 pages