任务分阶段:基于演示的自动化课程学习
机器学习
2023-03-29 v2 人工智能
摘要
将强化学习(RL)应用于稀疏奖励领域因缺乏引导信号而 notoriously 具有挑战性。解决此类领域的常见 RL 技术包括(1)从演示中学习和(2)课程学习。尽管这两种方法已被详细研究,却鲜少被综合考虑。本文旨在通过引入一种原则性的任务分阶段方法来实现这一点,该方法利用演示自动生成课程序列。通过使用(次优)演示的逆 RL,我们定义一个简单的初始任务。我们的任务分阶段方法随后提供一个框架,在每次分阶段迭代中逐步增加任务复杂度直至目标任务,同时重新调整 RL 智能体。考虑了两种分阶段方法:(1)逐步增加 RL 智能体处于控制的时间步比例,(2)逐步淘汰引导性信息奖励函数。我们给出了保证这些方法收敛到最优策略的条件。在 3 个稀疏奖励领域的实验结果表明,我们的任务分阶段方法在渐近性能上优于最先进方法。
引用
@article{arxiv.2210.10999,
title = {Task Phasing: Automated Curriculum Learning from Demonstrations},
author = {Vaibhav Bajaj and Guni Sharon and Peter Stone},
journal= {arXiv preprint arXiv:2210.10999},
year = {2023}
}
备注
7 pages main paper, 7 figures, 4 pages appendix. Submitted to AAAI 2023 Conference