中文

面向动态人口博弈的无模型学习:一种关于因果经济学的应用

计算机科学与博弈论 2026-05-13 v1 人工智能

摘要

动态人口博弈(DPG)为建模大规模自利代理人的战略互动提供了可行框架,已成功应用于因果经济学的设计——一种公平的非货币化资源分配机制。尽管具有吸引力的理论属性,但现有计算工具假设完全掌握博弈模型并以集中式方式运行,限制了其在代理人仅能访问自身私人经验的真实场景中的适用性。本文通过研究无模型均衡学习在因果 DPG 中的应用,着眼解决这一鸿沟。首先,我们分析了在因果 DPG 已处于平稳纳什均衡(SNE)状态时, novel agent 如何通过深度 Q 网络(DQN)在无博弈模型知识的情况下学习策略。基于 DQN 最近的收敛结果,我们建立了亚最优界,包含 O(1/Ns)O(1/\sqrt{N_s}) 级的 DQN 近似误差和 O(1/N)O(1/N) 级的均值场扰动误差,其中 NsN_s 为回放缓冲区大小,NN 为人口规模。其次,我们考虑从零开始学习 SNE 的挑战性问题。我们通过实证结果表明,结合深度强化学习、虚假博弈和平滑策略迭代,可使代理人以无模型方式收敛至接近集中计算 SNE 的配置。这些贡献支持将因果经济学作为公平资源分配的实用工具这一愿景。

关键词

引用

@article{arxiv.2605.11042,
  title  = {Towards Model-Free Learning in Dynamic Population Games: An Application to Karma Economies},
  author = {Matteo Cederle and Saverio Bolognani and Gian Antonio Susto},
  journal= {arXiv preprint arXiv:2605.11042},
  year   = {2026}
}