中文

作为深度强化学习辅助任务的终止预测

机器学习 2019-07-26 v1 多智能体系统 机器学习

摘要

深度强化学习近年来取得了巨大成功,但仍存在诸如收敛到局部最优策略以及样本效率低等开放性挑战。在本文中,我们提出了一种新颖的自监督辅助任务,即终止预测(Terminal Prediction, TP),用于估计情节式任务中到终止状态的时间接近程度。其直观想法是通过让智能体在学习的控制策略的同时预测其距离终止状态有多近,从而辅助表征学习。尽管 TP 可与多种算法集成,本文聚焦于异步优势 actor-critic(A3C)并展示 A3C-TP 的优势。我们的广泛评估包括:一组 Atari 游戏、BipedalWalker 领域,以及最近提出的多智能体 Pommerman 游戏的一个迷你版本。我们在 Atari 游戏和 BipedalWalker 领域上的结果表明,A3C-TP 在大多数测试领域中优于标准 A3C,在其他领域中表现相近。在 Pommerman 中,我们提出的方法在学习效率和对不同对手收敛到更优策略方面均提供了显著改进。

关键词

引用

@article{arxiv.1907.10827,
  title  = {Terminal Prediction as an Auxiliary Task for Deep Reinforcement Learning},
  author = {Bilal Kartal and Pablo Hernandez-Leal and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:1907.10827},
  year   = {2019}
}

备注

AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE'19). arXiv admin note: text overlap with arXiv:1812.00045