从不完美演示中进行强化学习
人工智能
2019-05-31 v2 机器学习
机器学习
摘要
鲁棒的真实世界学习应同时受益于演示与和环境的交互。当前从演示与奖励中学习的方法在专家演示数据上进行监督学习,并利用强化学习基于环境获得的奖励进一步提升性能。这些任务具有难以联合优化的发散损失,且此类方法对含噪演示非常敏感。我们提出一种统一的强化学习算法——归一化 Actor-Critic(NAC),其有效归一化 Q 函数,降低了演示数据中未出现动作的 Q 值。NAC 从演示中学习初始策略网络,并在环境中精炼策略,超越演示者性能。关键在于,从演示学习与交互精炼使用同一目标,不同于以往结合不同监督与强化损失的方法。这使得 NAC 对次优演示数据具有鲁棒性,因为该方法不被强迫模仿数据集中的所有样本。我们表明,在多个真实驾驶游戏上评估时,我们的统一强化学习算法能鲁棒学习并优于现有基线。
引用
@article{arxiv.1802.05313,
title = {Reinforcement Learning from Imperfect Demonstrations},
author = {Yang Gao and Huazhe Xu and Ji Lin and Fisher Yu and Sergey Levine and Trevor Darrell},
journal= {arXiv preprint arXiv:1802.05313},
year = {2019}
}