中文

约束逆强化学习中的可辨识性与泛化性

机器学习 2023-06-02 v1 人工智能 系统与控制 系统与控制 最优化与控制

摘要

强化学习(RL)的两个主要挑战是设计合适的奖励函数以及确保所学策略的安全性。为应对这些挑战,我们提出了一个针对约束马尔可夫决策过程的逆强化学习(IRL)理论框架。从凸分析视角出发,我们将先前关于奖励可辨识性与泛化性的结果推广到约束设定以及更一般的正则化类别。具体而言,我们表明,在势能整形意义下的可辨识性(Cao et al., 2021)是熵正则化的结果,并且在其他正则化或存在安全约束的情况下通常不再成立。我们还表明,为确保对新的转移律与约束的泛化能力,必须辨识出真实奖励直至一个常数。此外,我们推导了所学奖励次优性的有限样本保证,并在网格世界环境中验证了我们的结果。

关键词

引用

@article{arxiv.2306.00629,
  title  = {Identifiability and Generalizability in Constrained Inverse Reinforcement Learning},
  author = {Andreas Schlaginhaufen and Maryam Kamgarpour},
  journal= {arXiv preprint arXiv:2306.00629},
  year   = {2023}
}

备注

Published at ICML 2023