中文

基于后见逆动力学的策略延续

机器学习 2019-11-04 v2 机器学习

摘要

解决目标导向任务是强化学习(RL)中重要但具挑战性的问题。对此类任务,奖励往往稀疏,导致难以有效学习策略。为应对此困难,我们提出一种称为基于后见逆动力学的策略延续(PCHID)的新方法。该方法基于后见经验回放从后见逆动力学学习,以自模仿方式实现学习过程,从而可用监督学习训练。本工作还将其通过策略延续扩展到多步设定。所提方法具有通用性,可独立工作也可与其他同策略与异策略算法结合。在GridWorld与FetchReach两个多目标任务上,PCHID显著提升了样本效率及最终性能。

关键词

引用

@article{arxiv.1910.14055,
  title  = {Policy Continuation with Hindsight Inverse Dynamics},
  author = {Hao Sun and Zhizhong Li and Xiaotong Liu and Dahua Lin and Bolei Zhou},
  journal= {arXiv preprint arXiv:1910.14055},
  year   = {2019}
}