具有线性函数逼近的领导-跟随马尔可夫决策过程中可证明高效的无模型强化学习
机器学习
2023-01-10 v2 计算机科学与博弈论
多智能体系统
系统与控制
系统与控制
摘要
我们考虑一个多智能体情景式马尔可夫决策过程(MDP)设置,其中一个智能体(领导者)在情景的每一步采取行动,随后另一个智能体(跟随者)采取行动。状态演化和奖励取决于领导者和跟随者的联合行动对。这种类型的交互可以在智能电网、机制设计、安全和政策制定等许多领域找到应用。我们关注的是如何在赌博机反馈设置下,为双方学习具有可证明性能保证的策略。我们专注于领导者和跟随者都是非短视的(即他们都寻求在整个情景中最大化其奖励)的设置,并考虑一个可以建模连续状态空间的线性MDP,这在许多强化学习应用中非常常见。我们提出了一种无模型强化学习算法,并证明对于领导者和跟随者都可以实现 的遗憾界,其中 是特征映射的维度, 是情景的长度, 是赌博机反馈信息设置下的总步数。因此,即使状态数量变为无穷大,我们的结果依然成立。该算法依赖于对LSVI-UCB算法的新颖改编。具体来说,我们用soft-max策略替换了领导者和跟随者的标准贪婪策略(作为最佳响应)。这被证明是建立值函数一致浓度界的关键。据我们所知,这是第一个针对具有非短视跟随者和函数逼近的马尔可夫博弈的次线性遗憾界保证。
引用
@article{arxiv.2211.15792,
title = {Provably Efficient Model-free RL in Leader-Follower MDP with Linear Function Approximation},
author = {Arnob Ghosh},
journal= {arXiv preprint arXiv:2211.15792},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2206.11889