基于统计奖励累积改进同策略学习
机器学习
2018-09-10 v1 人工智能
机器学习
摘要
深度强化学习近年来取得了显著突破。深度强化学习中的多数方法通过最大化环境提供的奖励信号(通常形式为折扣累积回报)来获得良好结果。此类奖励信号表示智能体执行特定动作的即时反馈。然而,具有稀疏奖励信号的任务对同策略方法而言仍具挑战性。本文引入对过去奖励统计(可视为长期反馈信号)的有效刻画,以补充该即时奖励反馈。特别地,值函数通过多评论家监督进行学习,使得即便奖励信号稀疏,复杂值函数也能在同策略学习中更易被近似。我们还引入一种称为“hot-wiring”的新型探索机制,可为看似陷入困境的智能体提供助力。我们在Atari游戏的离散域以及MuJoCo环境的连续域中展示了优势动作多评论家(A2MC)方法的有效性。视频演示见 https://youtu.be/zBmpf3Yz8tc。
引用
@article{arxiv.1809.02387,
title = {Improving On-policy Learning with Statistical Reward Accumulation},
author = {Yubin Deng and Ke Yu and Dahua Lin and Xiaoou Tang and Chen Change Loy},
journal= {arXiv preprint arXiv:1809.02387},
year = {2018}
}