尝试再次而非尝试更久:用于自动课程学习的先验学习
机器学习
2020-04-08 v1 人工智能
机器学习
摘要
深度强化学习(DRL)社区的一个主要挑战是训练能够泛化到未见情形的智能体,这通常通过让其在多样化任务(或环境)上训练来实现。促进多样性的一种有力方法是程序化生成任务,从其多维分布中采样参数,特别地可为每个训练回合提供不同任务。实践中,为获得泛化所需的训练任务高多样性,必须使用复杂的程序化生成系统。对于此类生成器,很难获取关于实际可学习的任务子集(许多生成任务可能不可学习)、其相对难度以及最高效的任务分布训练顺序的先验知识。此类情况下的典型解决方案是依赖某种形式的自动课程学习(ACL)来调整采样分布。当前方法的一个局限是需探索任务空间以随时间检测进展生态位,这导致时间损失。此外,我们假设训练数据中引入的噪声可能损害脆弱 DRL 学习器的性能。我们通过提出两阶段 ACL 方法来解决该问题:1)教师算法首先以高探索课程学习训练 DRL 智能体,然后 2)从首次运行中提炼学习到的先验以生成“专家课程”从头重新训练同一智能体。除了展示比当前最先进水平平均提高 50% 外,本工作的目标是给出面向在多个学习器上精炼 ACL 技术这一新研究方向的首个示例,我们称之为课堂式教学(Classroom Teaching)。
引用
@article{arxiv.2004.03168,
title = {Trying AGAIN instead of Trying Longer: Prior Learning for Automatic Curriculum Learning},
author = {Rémy Portelas and Katja Hofmann and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:2004.03168},
year = {2020}
}
备注
Accepted to the ICLR 2020 workshop Beyond tabula rasa in RL (BeTR-RL)