中文

随机博弈中的常数记忆策略:最佳响应与均衡

计算机科学与博弈论 2025-10-16 v2 多智能体系统

摘要

随机博弈已成为研究长期多智能体相互作用的常用框架,尤其在多智能体强化学习语境中。本文全面探讨了随机博弈中的常数记忆策略概念。首先,我们在行为常数记忆策略上建立了关于最佳响应和纳什均衡的一些结果,随后讨论了针对混合常数记忆策略的最佳响应计算难度。这些理论见解随后在几个序列决策测试环境中得到验证,包括iterated Prisoner's Dilemma(迭代囚徒困境)、iterated Traveler's Dilemma(迭代旅行者困境)以及Pursuit(追逐)领域。本工作旨在增进对单智能体规划在多智能体系统中理论问题的理解,并揭示单智能体与多智能体情境下决策模型之间的联系。代码已公开于https://github.com/Fernadoo/Const-Mem。

引用

@article{arxiv.2505.07008,
  title  = {Constant-Memory Strategies in Stochastic Games: Best Responses and Equilibria},
  author = {Fengming Zhu and Fangzhen Lin},
  journal= {arXiv preprint arXiv:2505.07008},
  year   = {2025}
}

备注

21 pages. Under review