中文

选项兼容奖励逆强化学习

机器学习 2021-01-20 v2 机器学习

摘要

复杂环境中的强化学习是一个具有挑战性的问题。特别是,强化学习算法的成功依赖于设计良好的奖励函数。逆强化学习(IRL)解决了从专家示范中恢复奖励函数的问题。在本文中,我们在选项(options)框架下解决一个分层逆强化学习问题,这使我们能够利用专家示范的内在动机。采用参数化选项的梯度方法来推导 Q-特征空间的定义方程,进而导出奖励特征空间。利用选项参数的二阶最优性条件,选取最优奖励函数。在离散与连续域中的实验结果证实,我们恢复的奖励利用时间抽象解决了 IRL 问题,进而有效加速了迁移学习任务。我们还表明,我们的方法对专家示范中包含的噪声具有鲁棒性。

关键词

引用

@article{arxiv.1911.02723,
  title  = {Option Compatible Reward Inverse Reinforcement Learning},
  author = {Rakhoon Hwang and Hanjin Lee and Hyung Ju Hwang},
  journal= {arXiv preprint arXiv:1911.02723},
  year   = {2021}
}

备注

This paper is under consideration at Pattern Recognition Letters