基于概率图模型融合 GAIL 模仿学习与任务达成奖励强化学习
机器学习
2023-01-18 v2 人工智能
机器学习
摘要
强化学习与模仿学习的融合是智能机器人领域长期研究的重要问题。强化学习优化策略以最大化累积奖励,而模仿学习试图从专家(即示范者)演示的轨迹中提取通用知识。由于二者各有缺陷,迄今为止已探索了将二者结合并互补缺陷的方法。然而,许多方法是启发式的,缺乏坚实的理论基础。本文通过扩展强化学习的概率生成模型框架({\it plan by inference}),提出了一种融合强化学习与模仿学习的新理论。我们为具有多类奖励的强化学习开发了新的概率图模型,以及具有多重最优发射的马尔可夫决策过程的概率图模型(pMDP-MO)。此外,我们证明,通过将生成对抗模仿学习中的判别器输出视为额外的优化发射观测,强化与模仿学习的融合方法可表述为 pMDP-MO 上策略的概率推断。我们将生成对抗模仿学习(GAIL)与任务达成奖励适配到所提框架中,取得了显著优于单独使用强化学习或模仿学习训练的智能体的性能。实验表明,即使示范者数量极少,我们的框架也能成功融合模仿与强化学习。
引用
@article{arxiv.1907.02140,
title = {Integration of Imitation Learning using GAIL and Reinforcement Learning using Task-achievement Rewards via Probabilistic Graphical Model},
author = {Akira Kinose and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:1907.02140},
year = {2023}
}
备注
Submitted to Advanced Robotics