中文

面向机器人控制的选项感知对抗逆强化学习

机器学习 2023-05-29 v5 人工智能 机器人学

摘要

分层模仿学习(HIL)已被提出,通过用选项框架建模任务层次结构,从专家示范中恢复长视野任务中的高度复杂行为。现有方法要么忽视子任务与其对应策略之间的因果关系,要么无法以端到端方式学习策略,导致次优性。本工作中,我们基于对抗逆强化学习开发了一种新颖的 HIL 算法,并采用期望最大化算法对其进行适配,以直接从无标注示范中恢复分层策略。进一步,我们在目标函数中引入有向信息项以增强因果性,并提出变分自编码器框架以端到端方式依据我们的目标进行学习。我们提供了理论依据以及在具挑战性机器人控制任务上的评估,以展示我们算法的优越性。代码见 https://github.com/LucasCJYSDL/HierAIRL。

关键词

引用

@article{arxiv.2210.01969,
  title  = {Option-Aware Adversarial Inverse Reinforcement Learning for Robotic Control},
  author = {Jiayu Chen and Tian Lan and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2210.01969},
  year   = {2023}
}

备注

This paper is partly presented at IEEE International Conference on Robotics and Automation (ICRA 2023)