中文

通过轨迹空间平滑学习引导奖励

机器学习 2020-10-27 v1 机器学习

摘要

长期时间信用分配是深度强化学习(RL)中的一个重要挑战。它指的是智能体将动作归因于可能在长时间间隔后发生的后果的能力。现有的策略梯度和 Q-learning 算法通常依赖于稠密的环境奖励,这些奖励提供丰富的短期监督并有助于信用分配。然而,当动作与相应奖励反馈之间存在延迟时,它们难以解决任务。为了使信用分配更容易,近期工作提出了学习稠密“引导”奖励的算法,以替代稀疏或延迟的环境奖励。本文沿同一思路——从一个涉及轨迹空间平滑的代理 RL 目标出发,我们得到了一种学习引导奖励的新算法。我们表明,引导奖励具有直观的解释,并且可以在不训练任何额外神经网络的情况下获得。由于易于集成,我们在几种流行算法(Q-learning、Actor-Critic、Distributional-RL)中使用了引导奖励,并在单智能体和多智能体任务中展示了结果,阐明了当环境奖励稀疏或延迟时我们方法的益处。

关键词

引用

@article{arxiv.2010.12718,
  title  = {Learning Guidance Rewards with Trajectory-space Smoothing},
  author = {Tanmay Gangwani and Yuan Zhou and Jian Peng},
  journal= {arXiv preprint arXiv:2010.12718},
  year   = {2020}
}

备注

NeurIPS 2020 camera-ready