迈向对逆强化学习的理论理解
机器学习
2023-04-26 v1
摘要
逆强化学习(IRL)表示一类强大的算法,用于恢复能解释专家智能体所演示行为的奖励函数。IRL 的一个众所周知的限制是奖励函数选择上的歧义性,因为存在多个能解释观测行为的奖励。该限制近期通过将 IRL 表述为估计可行奖励集(即与专家行为相容的奖励区域)的问题而得以规避。本文朝填补有限时域、含生成模型情形下 IRL 的理论空白迈出一步。我们首先正式引入估计可行奖励集的问题、相应的 PAC 要求,并讨论特定奖励类的性质。随后,我们给出估计可行奖励集问题样本复杂度的首个极小极大下界,阶为 ,其中 和 分别为状态数与动作数, 为时域, 为期望精度, 为置信度。我们分析了均匀采样策略(US-IRL)的样本复杂度,证明了直至对数因子匹配的上界。最后,我们概述 IRL 中若干开放问题并提议未来研究方向。
引用
@article{arxiv.2304.12966,
title = {Towards Theoretical Understanding of Inverse Reinforcement Learning},
author = {Alberto Maria Metelli and Filippo Lazzati and Marcello Restelli},
journal= {arXiv preprint arXiv:2304.12966},
year = {2023}
}
备注
Submitted to: ICML23