中文

面向情节式强化学习的时间信用分配序列建模

机器学习 2019-06-03 v1 机器学习

摘要

深度强化学习算法的最新进展在解决包括围棋游戏和机器人应用在内的许多具有挑战性的现实世界问题方面展现出巨大潜力与成功。通常,这些算法需要精心设计的奖励函数以在每一步引导训练。然而在现实世界中,设计这样的奖励函数并非易事,且唯一可用的信号通常只能在轨迹结束时获得,即情节式奖励或回报。本工作中,我们引入一种用于时间信用分配的新算法,其利用深度神经网络学习将情节式回报分解回轨迹中的各个时间步。借助该学习到的奖励信号,情节式强化学习的学习效率可得到显著提升。特别地,我们发现诸如 Transformer 这类富有表达力的语言模型可用于学习轨迹中状态的重要性和依赖性,从而提供高质量且可解释的所学奖励信号。我们在一组仅含情节式回报的 MuJoCo 连续运动控制任务上进行了大量实验,证明了我们算法的有效性。

关键词

引用

@article{arxiv.1905.13420,
  title  = {Sequence Modeling of Temporal Credit Assignment for Episodic Reinforcement Learning},
  author = {Yang Liu and Yunan Luo and Yuanyi Zhong and Xi Chen and Qiang Liu and Jian Peng},
  journal= {arXiv preprint arXiv:1905.13420},
  year   = {2019}
}