中文

面向逆强化学习的主动探索

机器学习 2023-08-23 v4 人工智能 机器学习

摘要

逆强化学习(IRL)是一种从专家示范推断奖励函数的强大范式。许多IRL算法要求已知的转移模型,有时甚至要求已知的专家策略,或至少要求访问生成模型。然而,这些假设对于许多真实世界应用而言过于强烈,在那些应用中环境只能通过对序贯交互来访问。我们提出了一种新颖的IRL算法:面向逆强化学习的主动探索(AceIRL),它主动探索未知环境和专家策略,以快速学习专家的奖励函数并识别一个良好策略。AceIRL利用先前的观测构建置信区间,捕捉合理的奖励函数,并寻找聚焦于环境中最具信息性区域的探索策略。AceIRL是首个不需要环境生成模型且具有样本复杂度界的主动IRL方法。AceIRL在最坏情况下匹配带有生成模型的主动IRL的样本复杂度。此外,我们建立了一个问题依赖的界,将AceIRL的样本复杂度与给定IRL问题的次优间隙相关联。我们在仿真中对AceIRL进行了经验评估,发现其显著优于更朴素的探索策略。

关键词

引用

@article{arxiv.2207.08645,
  title  = {Active Exploration for Inverse Reinforcement Learning},
  author = {David Lindner and Andreas Krause and Giorgia Ramponi},
  journal= {arXiv preprint arXiv:2207.08645},
  year   = {2023}
}

备注

Presented at Conference on Neural Information Processing Systems (NeurIPS), 2022