从演示中通过负采样学习可自纠正的策略与值函数
机器学习
2019-10-14 v3 人工智能
机器学习
摘要
模仿学习继之以强化学习算法,是解决复杂控制任务且样本高效的有前景范式。然而,从演示中学习常受协变量偏移问题困扰,导致所学策略的级联误差。我们引入保守外推值函数的概念,其可证明导出具有自纠正能力的策略。我们设计了负采样值迭代(VINS)算法,该算法在实践中以保守外推学习此类值函数。我们展示 VINS 能够纠正行为克隆策略在模拟机器人基准任务上的错误。我们还提出使用 VINS 初始化强化学习算法的方案,其被证明在样本效率上显著优于先前工作。
引用
@article{arxiv.1907.05634,
title = {Learning Self-Correctable Policies and Value Functions from Demonstrations with Negative Sampling},
author = {Yuping Luo and Huazhe Xu and Tengyu Ma},
journal= {arXiv preprint arXiv:1907.05634},
year = {2019}
}