中文

图上基于博弈论的资源分配强化学习

机器学习 2025-05-13 v1 计算机科学与博弈论

摘要

图上博弈论资源分配(GRAG)涉及两位玩家在多个时间步骤上竞争控制感兴趣的节点,这一问题被建模为多步骤 Colonel Blotto Game(MCBG)。由于动态动作空间和由图结构施加的约束,寻找最优策略具有挑战性。为此,我们将MCBG建模为马尔可夫决策过程(MDP),并应用强化学习(RL)方法,具体包括Deep Q-Network(DQN)和Proximal Policy Optimization(PPO)。为强制执行图约束,我们引入一种动作位移邻接矩阵,用于在每个步骤动态生成有效动作集合。我们在多种图结构和初始资源分布下评估了RL性能,比较了随机策略、贪心策略和学习到的RL策略。实验结果表明,DQN和PPO均一致优于基线策略,并在与学习到的RL策略对战时收敛至50%的平衡胜率。特别是在非对称图上,RL智能体成功地利用结构优势并适应资源分配策略,即使在初始资源分布不利的情况下也能做到如此。

关键词

引用

@article{arxiv.2505.06319,
  title  = {Reinforcement Learning for Game-Theoretic Resource Allocation on Graphs},
  author = {Zijian An and Lifeng Zhou},
  journal= {arXiv preprint arXiv:2505.06319},
  year   = {2025}
}

备注

12 pages, 7 figures