面向动态人口博弈的无模型学习:一种关于因果经济学的应用
计算机科学与博弈论
2026-05-13 v1 人工智能
摘要
动态人口博弈(DPG)为建模大规模自利代理人的战略互动提供了可行框架,已成功应用于因果经济学的设计——一种公平的非货币化资源分配机制。尽管具有吸引力的理论属性,但现有计算工具假设完全掌握博弈模型并以集中式方式运行,限制了其在代理人仅能访问自身私人经验的真实场景中的适用性。本文通过研究无模型均衡学习在因果 DPG 中的应用,着眼解决这一鸿沟。首先,我们分析了在因果 DPG 已处于平稳纳什均衡(SNE)状态时, novel agent 如何通过深度 Q 网络(DQN)在无博弈模型知识的情况下学习策略。基于 DQN 最近的收敛结果,我们建立了亚最优界,包含 级的 DQN 近似误差和 级的均值场扰动误差,其中 为回放缓冲区大小, 为人口规模。其次,我们考虑从零开始学习 SNE 的挑战性问题。我们通过实证结果表明,结合深度强化学习、虚假博弈和平滑策略迭代,可使代理人以无模型方式收敛至接近集中计算 SNE 的配置。这些贡献支持将因果经济学作为公平资源分配的实用工具这一愿景。
引用
@article{arxiv.2605.11042,
title = {Towards Model-Free Learning in Dynamic Population Games: An Application to Karma Economies},
author = {Matteo Cederle and Saverio Bolognani and Gian Antonio Susto},
journal= {arXiv preprint arXiv:2605.11042},
year = {2026}
}