用粘性手套探索:基于选项模板的专家干预强化学习
机器学习
2022-11-18 v3 人工智能
机器学习
摘要
具有稀疏奖励的长时域机器人学习任务对当前强化学习算法提出了重大挑战。使人类能够学习困难控制任务的一个关键特征是,他们经常接受专家干预,这使他们能够在掌握低级控制动作之前理解任务的高层结构。我们提出了一个利用专家干预来解决长时域强化学习任务的框架。我们考虑“选项模板”,即编码可用强化学习训练的潜在选项的规范。我们将专家干预表述为允许智能体在学习实现之前执行选项模板。这使他们能够使用选项,而无需先投入昂贵资源去学习它。我们在三个具有挑战性的强化学习问题上评估了我们的方法,表明它比最先进的 (SOTA) 方法高出两个数量级。训练智能体的视频和我们的代码可在:https://sites.google.com/view/stickymittens 找到。
引用
@article{arxiv.2202.12967,
title = {Exploring with Sticky Mittens: Reinforcement Learning with Expert Interventions via Option Templates},
author = {Souradeep Dutta and Kaustubh Sridhar and Osbert Bastani and Edgar Dobriban and James Weimer and Insup Lee and Julia Parish-Morris},
journal= {arXiv preprint arXiv:2202.12967},
year = {2022}
}
备注
Conference on Robot Learning (CoRL) 2022