中文

DIRECT:利用判别式奖励协同训练从稀疏与漂移奖励中学习

机器学习 2023-01-19 v1

摘要

我们提出判别式奖励协同训练(DIRECT)作为深度强化学习算法的扩展。在自模仿学习(SIL)概念的基础上,我们引入一个模仿缓冲区,用于存储由策略生成的、依据其回报判定的有益轨迹。一个判别器网络与策略同时训练,以区分当前策略生成的轨迹与先前策略生成的有益轨迹。判别器的判定被用于构造用于优化策略的奖励信号。通过插值先前的经验,DIRECT 能够充当代理,将策略优化引导至奖励景观中更有价值的区域,从而学习到最优策略。我们的结果表明,DIRECT 在稀疏与漂移奖励环境中优于最先进的算法,能够为策略提供代理奖励并将优化导向有价值区域。

关键词

引用

@article{arxiv.2301.07421,
  title  = {DIRECT: Learning from Sparse and Shifting Rewards using Discriminative Reward Co-Training},
  author = {Philipp Altmann and Thomy Phan and Fabian Ritz and Thomas Gabor and Claudia Linnhoff-Popien},
  journal= {arXiv preprint arXiv:2301.07421},
  year   = {2023}
}

备注

9 pages, 10 figures, under review