中文

通过线性函数逼近驾驭大规模鲁棒马尔可夫游戏的多主体诅咒

机器学习 2026-05-08 v2

摘要

多智能体强化学习 (MARL) 具有巨大潜力,但因环境不确定性面临鲁棒性挑战。为此,分布式鲁棒马尔可夫游戏 (RMG) 在环境偏离 nominal 模型于不确定性集内的情形下,优化最坏情况性能。除鲁棒性外,MARL 同样迫在眉睫的目标是数据效率——从规模随智能体数量指数增长的广阔状态与动作空间抽样,可能导致多主体诅咒。然而,当前针对 RMG 的可证数据高效算法仅限于有限状态与动作空间的表格设置,对小规模问题才可计算管理, leaves RMG 在大规模(或无限)状态空间 largely unexplored。唯一已有的表格之外工作聚焦于 RMG 的线性函数逼近 (LFA),但仅适用于限制性 RMG 类型,使用消失最小价值假设,仍受多主体诅咒的样本复杂度制约。本文聚焦于一般化的 RMG 与 LFA。对于由总变差距离定义的不确定性集,我们发展出在生成模型setting 和新提出的 online interactive setting 下,能够打破多主体诅咒的数据高效算法。据我们了解,本研究是首个在样本复杂度层面突破 RMG 大(可能无限)状态空间多主体诅咒的工作,无论不确定性集如何构建。

关键词

引用

@article{arxiv.2605.03125,
  title  = {Taming the Curses of Multiagency in Robust Markov Games with Large State Space through Linear Function Approximation},
  author = {Jingchu Gai and Laixi Shi},
  journal= {arXiv preprint arXiv:2605.03125},
  year   = {2026}
}