AC-Teach:一种利用次优教师集成的策略学习贝叶斯 actor-critic 方法
机器学习
2019-12-17 v3 人工智能
机器学习
摘要
深度强化学习(RL)智能体所使用的探索机制在其样本效率方面起着关键作用。因此,改进随机探索对于解决具有稀疏奖励的长视野任务至关重要。我们提议利用一组部分解作为教师,在训练过程中通过动作建议引导智能体的探索。尽管带教师学习的设定先前已被研究,我们提出的方法——带教师集成的 Actor-Critic(AC-Teach)——是首个处理可能仅解决部分问题或相互矛盾的次优教师集成的方法,形成了一种与广泛教师集成兼容的统一算法解。AC-Teach 利用教师与学生的动作期望结果的概率表示来引导探索、减少抖动,并适应学习者动态变化的质量。我们评估了 AC-Teach 的一个变体,该变体在三项任务上引导贝叶斯 DDPG 智能体的学习——路径跟随、机器人拾放,以及使用钩子的机器人扫立方体——并表明相较于一组基线,无论在不受约束的次优教师这一目标场景,还是在更简单的最优或单一教师设定下,其样本效率均有大幅提升。更多结果与视频见 https://sites.google.com/view/acteach/home。
引用
@article{arxiv.1909.04121,
title = {AC-Teach: A Bayesian Actor-Critic Method for Policy Learning with an Ensemble of Suboptimal Teachers},
author = {Andrey Kurenkov and Ajay Mandlekar and Roberto Martin-Martin and Silvio Savarese and Animesh Garg},
journal= {arXiv preprint arXiv:1909.04121},
year = {2019}
}
备注
Conference on Robot Learning (CoRL) 2019