中文

逆向强化学习如何扩展到大规模状态空间?一种可证明高效的方法

机器学习 2024-10-10 v2

摘要

在在线逆向强化学习(IRL)中,学习者可以收集关于环境动态的样本来改进其对奖励函数的估计。由于IRL存在可识别性问题,许多关于在线IRL的理论工作侧重于估计解释演示的整个奖励集,称为可行奖励集。然而,现有文献中的算法都无法扩展到具有大状态空间的问题。在本文中,我们专注于线性马尔可夫决策过程(MDP)中的在线IRL问题。我们表明,当状态空间很大时,线性MDP提供的结构不足以有效估计可行集。因此,我们引入了奖励兼容性的新框架,它概括了可行集的概念,并开发了CATY-IRL,一种样本高效的算法,其复杂度在线性MDP中与状态空间的基数无关。当限制在表格设置时,我们证明CATY-IRL在忽略对数因子的情况下是极小化最优的。作为副产品,我们表明无奖励探索(RFE)具有相同的最坏情况速率,改进了现有技术的下界。最后,我们设计了一个IRL和RFE的统一框架,这可能具有独立的意义。

关键词

引用

@article{arxiv.2406.03812,
  title  = {How does Inverse RL Scale to Large State Spaces? A Provably Efficient Approach},
  author = {Filippo Lazzati and Mirco Mutti and Alberto Maria Metelli},
  journal= {arXiv preprint arXiv:2406.03812},
  year   = {2024}
}

备注

Advances in Neural Information Processing Systems 38 (NeurIPS 2024)