中文

演化随机策略蒸馏

机器学习 2020-05-01 v2 机器学习

摘要

由于奖励信号的稀疏性,求解目标条件稀疏奖励(Goal-Conditioned Reward Sparse, GCRS)任务是一个具有挑战性的强化学习问题。在这项工作中,我们从状态空间上漂移随机游走的视角对 GCRS 任务提出了新的表述,并基于减小该随机过程首次命中时间(First Hitting Time)的洞见设计了一种称为演化随机策略蒸馏(Evolutionary Stochastic Policy Distillation, ESPD)的新方法以求解此类任务。作为一种自模仿方法,ESPD 使目标策略通过策略蒸馏(policy distillation, PD)技术从一系列其随机变体中学习。ESPD 的学习机制可被视为一种演化策略(Evolution Strategy, ES),该策略直接在动作空间上对策略施加扰动,并通过一个 SELECT 函数来检验随机变体的优越性,随后利用 PD 更新策略。基于 MuJoCo 机器人控制套件的实验显示了所提方法的高学习效率。

关键词

引用

@article{arxiv.2004.12909,
  title  = {Evolutionary Stochastic Policy Distillation},
  author = {Hao Sun and Xinyu Pan and Bo Dai and Dahua Lin and Bolei Zhou},
  journal= {arXiv preprint arXiv:2004.12909},
  year   = {2020}
}