中文

带噪声演示监督的强化学习

机器学习 2020-06-16 v1 机器学习

摘要

强化学习在各种应用中取得了巨大成功。为了为智能体学习一个有效的策略,通常需要通过与环境的交互获取大量数据,这可能是计算成本高且耗时的。为了克服这一挑战,提出了称为“带专家演示的强化学习”(RLED)的框架,以利用来自专家演示的监督。尽管RLED方法可以减少学习迭代次数,但它们通常假设演示是完美的,因此在现实应用中可能被噪声演示严重误导。在本文中,我们提出了一种新颖的框架,通过与环境交互并同时利用专家演示来自适应地学习策略。具体来说,对于演示轨迹的每一步,我们形成一个实例,并定义一个联合损失函数,以同时最大化期望奖励并最小化智能体行为与演示之间的差异。最重要的是,通过计算价值函数的期望增益,我们为每个实例分配一个权重来估计其潜在效用,从而可以强调更有帮助的演示,同时过滤掉噪声演示。在多种环境中使用多种流行的强化学习算法进行的实验结果表明,所提出的方法能够在有噪声演示的情况下进行鲁棒学习,并在更少的迭代次数内实现更高的性能。

关键词

引用

@article{arxiv.2006.07808,
  title  = {Reinforcement Learning with Supervision from Noisy Demonstrations},
  author = {Kun-Peng Ning and Sheng-Jun Huang},
  journal= {arXiv preprint arXiv:2006.07808},
  year   = {2020}
}