通过子目标发现从轨迹中学习
机器学习
2019-11-19 v1 机器人学
机器学习
摘要
在仅有稀疏终止奖励的复杂目标导向任务中学习通常需要海量样本。在此类情况下,使用一组专家轨迹有助于加快学习。然而,通过这些轨迹进行有监督预训练的模仿学习(IL)可能表现不佳,且通常需要专家在环的额外微调。本文提出一种利用专家轨迹并学习将复杂主任务分解为较小子目标的方法。我们学习一个将状态空间划分为子目标的函数,随后可用于设计外在奖励函数。我们遵循一种策略:智能体首先利用 IL 从轨迹中学习,然后切换到使用已识别子目标的强化学习(RL),以缓解 IL 步骤中的误差。为处理轨迹集代表性不足的状态,我们还学习一个函数来调节子目标预测。我们表明,我们的方法能够解决其他 RL、IL 或其文献中组合所无法解决的复杂目标导向任务。
引用
@article{arxiv.1911.07224,
title = {Learning from Trajectories via Subgoal Discovery},
author = {Sujoy Paul and Jeroen van Baar and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:1911.07224},
year = {2019}
}
备注
NeurIPS 2019 Accepted