中文

利用专家策略拆分与合并的局部集成及重参数化实现高效示范强化学习

机器学习 2022-05-24 v1 机器学习

摘要

当前关于从示范中强化学习(RL)的工作常假设示范为最优策略的样本,这在实际中是不现实的假设。当示范由次优策略生成或具有稀疏状态-动作对时,从次优示范中学得的策略可能以不正确或非局部的动作决策误导智能体。我们提出一种称为专家策略拆分与合并的局部集成及重参数化(LEARN-SAM)的新方法,以提高效率并更好地利用次优示范。首先,LEARN-SAM 基于当前状态与示范状态之间的差异度量,采用一种新概念——lambda 函数,在学习过程中“局部化”专家策略的权重。其次,LEARN-SAM 采用拆分与合并(SAM)机制,通过分离各专家示范中有用的部分并将其重新组合为新的专家策略,以选择性地利用示范。lambda 函数与 SAM 机制均有助于提升学习速度。理论上,我们证明了重参数化策略在 SAM 机制前后的不变性,为所采用策略梯度方法的收敛性提供理论保证。在六个从低到高维复杂连续控制问题的实验中,与现有的从示范中 RL 方法相比,我们展示了 LEARN-SAM 方法的优越性及其在不同示范质量与稀疏度下的鲁棒性。

关键词

引用

@article{arxiv.2205.11019,
  title  = {Efficient Reinforcement Learning from Demonstration Using Local Ensemble and Reparameterization with Split and Merge of Expert Policies},
  author = {Yu Wang and Fang Liu},
  journal= {arXiv preprint arXiv:2205.11019},
  year   = {2022}
}

备注

This paper was accepted by IEEE COMPSAC 2022