高效逆强化学习中的人类交互式子目标监督
人机交互
2018-06-25 v1 人工智能
摘要
人类能够通过将任务策略性地结构化为渐进步骤或子目标来理解与执行复杂任务。对于试图学习具有关键子目标状态的序列任务的机器人,此类状态可为与人类专家交互提供天然契机。本文分析了在带有人类在环(HITL)框架的逆强化学习(IRL)中引入子目标概念的好处。学习过程具交互性:人类专家先以完整示范及若干子目标状态的形式提供输入;这些子目标状态为学习智能体定义了一组需完成的子任务以达成最终目标。当智能体在子任务上受困时,按需查询对应各子任务的部分示范。所提出的人类交互式IRL(HI-IRL)框架在若干离散路径规划任务上评估。我们证明,基于子目标的交互式任务结构化带来了显著更高效的学习,仅需基线IRL模型学习底层奖励函数所需示范数据的一小部分。
引用
@article{arxiv.1806.08479,
title = {Human-Interactive Subgoal Supervision for Efficient Inverse Reinforcement Learning},
author = {Xinlei Pan and Eshed Ohn-Bar and Nicholas Rhinehart and Yan Xu and Yilin Shen and Kris M. Kitani},
journal= {arXiv preprint arXiv:1806.08479},
year = {2018}
}