零和马尔可夫游戏鞍点上的双层优化
机器学习
2026-05-27 v1 人工智能
最优化与控制
机器学习
摘要
强化学习 (RL) 常具有层次结构,其中上层 (UL) 学习者选择模型参数,下层 (LL) 决策过程作出响应,自然导致双层优化问题。大多数现有双层 RL 方法假设 LL 为单一策略马尔可夫决策过程 (MDP),因此无法捕捉如激励设计等应用中出现的多策略相互作用的竞争结构。我们研究 LL 为正则化 min-max 零和马尔可夫游戏且 UL 目标通过 LL 游戏诱导的 saddle-point equilibrium 进行优化的双层优化问题。本文提出 penalty-augmented Nikaido-Isoda descent-ascent (PANDA),一种基于 Nikaido-Isoda 函数的惩罚化一阶策略梯度方法。通过利用 min-max 游戏结构,PANDA 避免计算 UL hypergradients,无需二阶信息。我们证明 PANDA 在不对 UL 或 LL 目标的凸性假设下即可收敛至 stationary 点。此外,PANDA 以 迭代次数达到 -stationary 点,样本复杂度为 ,匹配单策略 LL MDP 双层 RL 的最佳已知速率。实验表明 PANDA 在紧密相关基线上表现优异。
关键词
引用
@article{arxiv.2605.26654,
title = {Bilevel Optimization over Saddle Points of Zero-Sum Markov Games},
author = {Zihao Zheng and Irwin King and Songtao Lu},
journal= {arXiv preprint arXiv:2605.26654},
year = {2026}
}
备注
Accepted to the International Conference on Machine Learning (ICML 2026)