逆凹效用强化学习即逆博弈论
机器学习
2024-08-05 v3 人工智能
计算机科学与博弈论
多智能体系统
摘要
我们考虑凹效用逆强化学习问题。凹效用强化学习(CURL)是标准RL目标的推广,它使用状态占用测度的凹函数而非线性函数。CURL最近因其能够表示许多重要应用实例而受到关注,包括标准RL如模仿学习、纯探索、约束MDP、离线RL、人类正则化RL等。逆强化学习是一个强大的范式,专注于恢复能够解释观察到的智能体行为的未知奖励函数。最近在逆RL方面有理论进展,将问题表述为识别可行奖励函数的集合。然而,CURL问题的逆RL此前未被考虑。本文表明,大多数标准IRL结果通常不适用于CURL,因为CURL使经典贝尔曼方程失效。这需要为逆CURL问题建立新的理论框架。利用CURL与平均场博弈之间的最近等价性结果,我们通过证明该问题等价于平均场博弈子类中的逆博弈理论问题,提出了I-CURL可行奖励的新定义。我们概述了由我们的结果实现的未来方向和在人类-AI协作中的应用。
引用
@article{arxiv.2405.19024,
title = {Inverse Concave-Utility Reinforcement Learning is Inverse Game Theory},
author = {Mustafa Mert Çelikok and Frans A. Oliehoek and Jan-Willem van de Meent},
journal= {arXiv preprint arXiv:2405.19024},
year = {2024}
}