中文

从演示中通过负采样学习可自纠正的策略与值函数

机器学习 2019-10-14 v3 人工智能 机器学习

摘要

模仿学习继之以强化学习算法,是解决复杂控制任务且样本高效的有前景范式。然而,从演示中学习常受协变量偏移问题困扰,导致所学策略的级联误差。我们引入保守外推值函数的概念,其可证明导出具有自纠正能力的策略。我们设计了负采样值迭代(VINS)算法,该算法在实践中以保守外推学习此类值函数。我们展示 VINS 能够纠正行为克隆策略在模拟机器人基准任务上的错误。我们还提出使用 VINS 初始化强化学习算法的方案,其被证明在样本效率上显著优于先前工作。

关键词

引用

@article{arxiv.1907.05634,
  title  = {Learning Self-Correctable Policies and Value Functions from Demonstrations with Negative Sampling},
  author = {Yuping Luo and Huazhe Xu and Tengyu Ma},
  journal= {arXiv preprint arXiv:1907.05634},
  year   = {2019}
}