Trust-PCL:一种用于连续控制的离策略信任域方法
人工智能
2018-02-26 v3
摘要
信任域方法(如 TRPO)常用于稳定强化学习(RL)中的策略优化算法。尽管当前的信任域策略对连续控制有效,它们通常需要与环境的在策略交互量大得令人难以承受。为解决此问题,我们提出一种离策略信任域方法 Trust-PCL。该算法源于如下观察:带有相对熵正则化项的最大奖励目标的最优策略与状态值,沿任意路径满足一组多步路径一致性。因此,Trust-PCL 能在利用离策略数据提升样本效率的同时保持优化稳定性。在多个连续控制任务上评估时,Trust-PCL 提升了 TRPO 的解质量与样本效率。
引用
@article{arxiv.1707.01891,
title = {Trust-PCL: An Off-Policy Trust Region Method for Continuous Control},
author = {Ofir Nachum and Mohammad Norouzi and Kelvin Xu and Dale Schuurmans},
journal= {arXiv preprint arXiv:1707.01891},
year = {2018}
}
备注
ICLR 2018