线性马尔可夫决策过程中的表现性强化学习
机器学习
2025-03-18 v2 计算机科学与博弈论
摘要
我们研究了\emph{表现性强化学习(performative reinforcement learning)}的设置,其中部署的策略同时影响底层马尔可夫决策过程(Markov Decision Process, MDP)的奖励和转移。先前的研究\parencite{MTR23}在表格(tabular)设置下解决了该问题,并建立了重复重训练的末迭代收敛性,其迭代复杂度明确依赖于状态数量。在本工作中,我们将结果推广到\emph{线性马尔可夫决策过程(linear MDP)},这是大规模MDP的主要理论模型。线性MDP的主要挑战在于正则化目标不再强凸,我们希望得到一个随特征维度而非状态数量(状态数可以是无限的)扩展的界。我们的第一个结果表明,反复优化一个正则化目标会收敛到一个\emph{表现性稳定策略(performatively stable policy)}。在缺乏强凸性的情况下,我们的分析利用了一种新的递推关系,该关系使用最优对偶解的特定线性组合来证明收敛。然后我们处理有限样本设置,其中学习者可访问从当前策略中抽取的一组轨迹。我们考虑原问题的重参数化版本,并从样本中构建一个经验拉格朗日量(empirical Lagrangian)进行优化。我们证明,在\emph{有界覆盖(bounded coverage)}条件下,反复求解该经验拉格朗日量的鞍点(saddle point)会收敛到表现性稳定解,并构建了一个高效求解经验拉格朗日量的原对偶(primal-dual)算法。最后,我们展示了表现性RL的一般框架的若干应用,包括多智能体系统。
引用
@article{arxiv.2411.05234,
title = {Performative Reinforcement Learning with Linear Markov Decision Process},
author = {Debmalya Mandal and Goran Radanovic},
journal= {arXiv preprint arXiv:2411.05234},
year = {2025}
}
备注
In AISTATS-2025