中文

通过具有闭式奖励质心的逆强化学习泛化行为

机器学习 2025-09-16 v1 人工智能

摘要

我们研究将专家智能体的行为(通过演示提供)泛化到新环境和/或额外约束的问题。逆强化学习(IRL)提供了一种有前景的解决方案,它试图恢复专家潜在的奖励函数,如果该函数用于新环境中的规划,将重现期望的行为。然而,IRL本质上是病态的:多个奖励函数(形成所谓的可行集)可以解释相同的观测行为。由于这些奖励可能在新环境中诱导出不同的策略,在缺乏额外信息的情况下,需要一种决策标准来选择部署哪个策略。在本文中,我们提出了一种新颖的、有原则的标准,该标准选择可行集某个有界子集中奖励所诱导策略中的“平均”策略。值得注意的是,我们表明,该策略可以通过使用该子集的奖励质心进行规划来获得,我们为此推导出了一个闭式表达式。然后,我们提出了一种可证明高效的算法,仅使用专家演示的离线数据集来估计该质心。最后,我们进行了数值模拟,说明了专家行为与我们方法产生的行为之间的关系。

关键词

引用

@article{arxiv.2509.12010,
  title  = {Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids},
  author = {Filippo Lazzati and Alberto Maria Metelli},
  journal= {arXiv preprint arXiv:2509.12010},
  year   = {2025}
}