用树搜索与模仿学习求解基于图的公共物品博弈
人工智能
2021-10-27 v2 计算机科学与博弈论
机器学习
多智能体系统
摘要
公共物品博弈代表了研究个体 agent 做出贡献动机的深刻场景,这些贡献虽对每个 agent 而言代价高昂,却惠及更广泛的社会。在本工作中,我们采用中央计划者的视角,其全局观测由自利 agent 组成的网络,并以在最适公共物品博弈(best-shot public goods game)背景下最大化某种期望属性为目标。该已知 NP 完全问题的现有算法求得的解次优,且无法针对社会福祉以外的准则进行优化。为高效求解公共物品博弈,我们提出的方法直接利用均衡与图的最大独立集(mIS)结构性质之间的对应关系。具体而言,我们定义了一个逐步生成 mIS 的马尔可夫决策过程,并采用规划方法搜索均衡,优于现有方法。此外,我们设计了一种图模仿学习技术,利用搜索的演示获得由图神经网络参数化的策略,该策略可快速泛化至未见过的博弈实例。我们的评估结果表明,该策略能够达到规划方法 99.5% 的性能,同时在测试的最大图上评估速度快三个数量级。本工作提出的方法可应用于潜在社会影响巨大的广泛公共物品博弈类,更广泛地可应用于其他图组合优化问题。
引用
@article{arxiv.2106.06762,
title = {Solving Graph-based Public Good Games with Tree Search and Imitation Learning},
author = {Victor-Alexandru Darvariu and Stephen Hailes and Mirco Musolesi},
journal= {arXiv preprint arXiv:2106.06762},
year = {2021}
}
备注
To appear in Proceedings of 35th Conference on Neural Information Processing Systems (NeurIPS 2021)