中文

迈向对逆强化学习的理论理解

机器学习 2023-04-26 v1

摘要

逆强化学习(IRL)表示一类强大的算法,用于恢复能解释专家智能体所演示行为的奖励函数。IRL 的一个众所周知的限制是奖励函数选择上的歧义性,因为存在多个能解释观测行为的奖励。该限制近期通过将 IRL 表述为估计可行奖励集(即与专家行为相容的奖励区域)的问题而得以规避。本文朝填补有限时域、含生成模型情形下 IRL 的理论空白迈出一步。我们首先正式引入估计可行奖励集的问题、相应的 PAC 要求,并讨论特定奖励类的性质。随后,我们给出估计可行奖励集问题样本复杂度的首个极小极大下界,阶为 Ω(H3SAϵ2(log(1δ)+S)){\Omega}\Bigl( \frac{H^3SA}{\epsilon^2} \bigl( \log \bigl(\frac{1}{\delta}\bigl) + S \bigl)\Bigl),其中 SSAA 分别为状态数与动作数,HH 为时域,ϵ\epsilon 为期望精度,δ\delta 为置信度。我们分析了均匀采样策略(US-IRL)的样本复杂度,证明了直至对数因子匹配的上界。最后,我们概述 IRL 中若干开放问题并提议未来研究方向。

关键词

引用

@article{arxiv.2304.12966,
  title  = {Towards Theoretical Understanding of Inverse Reinforcement Learning},
  author = {Alberto Maria Metelli and Filippo Lazzati and Marcello Restelli},
  journal= {arXiv preprint arXiv:2304.12966},
  year   = {2023}
}

备注

Submitted to: ICML23