情境化 GAIL:基于任务条件对抗逆强化学习的多任务模仿
机器学习
2019-11-04 v1 人工智能
机器人学
摘要
生成对抗模仿学习(GAIL)在机器人学习领域引起了越来越多的关注。它使机器人能够学习策略以实现专家演示的任务,同时估计专家行为背后的奖励函数。然而,该框架局限于使用单一奖励函数学习单一任务。本研究提出一种称为情境化 GAIL(S-GAIL)的扩展框架,其中在 GAIL 框架的判别器和生成器中均引入任务变量。任务变量具有区分不同上下文并使框架为多个任务学习不同奖励函数和策略的作用。为实现学习的早期收敛和奖励估计过程中的鲁棒性,我们在生成器的目标函数中引入一项以调整熵正则化系数。我们使用两种设置(离散网格世界中的导航和连续空间中的机械臂到达)进行的实验表明,所提框架比现有框架能更有效地获取多个奖励函数和策略。任务变量使我们的框架能够区分上下文,同时在多个任务间共享通用知识。
引用
@article{arxiv.1911.00238,
title = {Situated GAIL: Multitask imitation using task-conditioned adversarial inverse reinforcement learning},
author = {Kyoichiro Kobayashi and Takato Horii and Ryo Iwaki and Yukie Nagai and Minoru Asada},
journal= {arXiv preprint arXiv:1911.00238},
year = {2019}
}
备注
Submitted to Advanced Robotics