基于最近发展区的示范深度强化学习教学策略
机器学习
2019-10-29 v1 人工智能
摘要
从示范中学习是一种流行的工具,用于加速强化学习并降低其探索需求。当向人类学生提供专家示范时,我们知道示范必须落在称为“最近发展区(ZPD)”的特定难度范围内。如果太容易,学生学不到东西;如果太难,学生则无法跟上。这就提出了一个问题:给定一组潜在的示范者,其中哪一个最适合教导任何特定的学习者?先前的工作,例如流行的从示范中深度 Q 学习(DQfD)算法,通常集中于单一示范者。在这项工作中,我们考虑在具有不同技能水平的多个示范者中进行选择的难题。我们的结果与人类学习者的直觉一致:从表现最好的示范者(就奖励而言)抽取示范并非总是最佳策略。我们表明,在九个 Atari 游戏中,仔细选择教学策略可以在学习者的环境中带来样本效率的提升。
引用
@article{arxiv.1910.12154,
title = {ZPD Teaching Strategies for Deep Reinforcement Learning from Demonstrations},
author = {Daniel Seita and David Chan and Roshan Rao and Chen Tang and Mandi Zhao and John Canny},
journal= {arXiv preprint arXiv:1910.12154},
year = {2019}
}
备注
Deep Reinforcement Learning Workshop at NeurIPS 2019