中文

Trust-PCL:一种用于连续控制的离策略信任域方法

人工智能 2018-02-26 v3

摘要

信任域方法(如 TRPO)常用于稳定强化学习(RL)中的策略优化算法。尽管当前的信任域策略对连续控制有效,它们通常需要与环境的在策略交互量大得令人难以承受。为解决此问题,我们提出一种离策略信任域方法 Trust-PCL。该算法源于如下观察:带有相对熵正则化项的最大奖励目标的最优策略与状态值,沿任意路径满足一组多步路径一致性。因此,Trust-PCL 能在利用离策略数据提升样本效率的同时保持优化稳定性。在多个连续控制任务上评估时,Trust-PCL 提升了 TRPO 的解质量与样本效率。

关键词

引用

@article{arxiv.1707.01891,
  title  = {Trust-PCL: An Off-Policy Trust Region Method for Continuous Control},
  author = {Ofir Nachum and Mohammad Norouzi and Kelvin Xu and Dale Schuurmans},
  journal= {arXiv preprint arXiv:1707.01891},
  year   = {2018}
}

备注

ICLR 2018