中文

迈向广义逆强化学习

机器学习 2024-02-13 v1

摘要

本文研究马尔可夫决策过程(MDP)中的广义逆强化学习(GIRL),即根据观测到的可能非最优的行为(策略)来学习MDP基本组件的问题。这些组件不仅包括奖励函数和转移概率矩阵,还包括不完全已知但已知属于给定不确定集的动作空间和状态空间。我们应对GIRL中的两个关键挑战:第一,需要量化观测策略与底层最优策略之间的差异;第二,当MDP的基本组件不可观测或部分可观测时,在数学上刻画底层最优策略的困难。随后,我们提出了GIRL的数学表述,并开发了一种快速启发式算法。在有限和无限状态问题上的数值结果显示了我们的表述和算法的优点。

关键词

引用

@article{arxiv.2402.07246,
  title  = {Towards Generalized Inverse Reinforcement Learning},
  author = {Chaosheng Dong and Yijia Wang},
  journal= {arXiv preprint arXiv:2402.07246},
  year   = {2024}
}