自博弈 Q 学习者可证明地在重复囚徒困境中合谋
计算机科学与博弈论
2025-12-23 v3
摘要
越来越多的计算研究表明,简单的机器学习代理在社会困境中会收敛至合作行为,例如寡头市场中的合谋定价,这引发了关于何种因素驱动该结果的疑问。本文在重复囚徒困境中自博弈多智能体 Q 学习者的背景下,为这一现象提供了理论基础。我们刻画了广泛的条件,在这些条件下,此类代理可证明地学习到合作的 Pavlov(赢则保持,输则切换)策略,而非帕累托劣质的“总是背叛”策略。我们通过额外实验验证了理论结果,证明了其在更广泛的深度学习算法类中的鲁棒性。
引用
@article{arxiv.2312.08484,
title = {Self-Play Q-learners Can Provably Collude in the Iterated Prisoner's Dilemma},
author = {Quentin Bertrand and Juan Duque and Emilio Calvano and Gauthier Gidel},
journal= {arXiv preprint arXiv:2312.08484},
year = {2025}
}