中文

带约束恢复的逆向强化学习

机器学习 2024-01-08 v1 人工智能

摘要

在这项工作中,我们提出了一种针对约束马尔可夫决策过程(CMDP)问题的新型逆向强化学习(IRL)算法。在标准 IRL 问题中,逆向学习者或智能体试图在给定最优策略的一组轨迹演示的情况下恢复 MDP 的奖励函数。在这项工作中,我们力求不仅推断 CMDP 的奖励函数,还推断其约束。利用最大熵原理,我们证明了带约束恢复的 IRL(IRL-CR)问题可化为一个约束非凸优化问题。我们将其简化为一个交替约束优化问题,其子问题是凸的。我们使用指数梯度下降算法来求解它。最后,我们在网格世界环境中展示了我们算法的有效性。

关键词

引用

@article{arxiv.2305.08130,
  title  = {Inverse Reinforcement Learning With Constraint Recovery},
  author = {Nirjhar Das and Arpan Chattopadhyay},
  journal= {arXiv preprint arXiv:2305.08130},
  year   = {2024}
}