中文

零阶监督策略改进

机器学习 2021-07-06 v2 人工智能 机器学习

摘要

策略梯度(PG)算法已被广泛应用于强化学习(RL)中。然而,PG 算法依赖于利用局部以一阶更新方式学习的价值函数,导致样本效率有限。在本工作中,我们提出一种称为零阶监督策略改进(ZOSPI)的替代方法。ZOSPI 在基于零阶策略优化保留 PG 方法局部利用能力的同时,全局地利用所估计的价值函数 QQ。该学习范式遵循 Q-learning,但克服了在连续动作空间中高效执行 argmax 的困难。它能在少量样本内找到最大价值动作。ZOSPI 的策略学习分两步:首先,采样动作并用学习的价值估计器评估这些动作,然后通过监督学习来学习执行价值最高的动作。我们进一步证明这种监督学习框架能够学习多模态策略。实验表明,ZOSPI 在连续控制基准上以显著的样本效率取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2006.06600,
  title  = {Zeroth-Order Supervised Policy Improvement},
  author = {Hao Sun and Ziping Xu and Yuhang Song and Meng Fang and Jiechao Xiong and Bo Dai and Bolei Zhou},
  journal= {arXiv preprint arXiv:2006.06600},
  year   = {2021}
}