无后悔学习在议价博弈中的最后迭代收敛性
计算机科学与博弈论
2025-07-08 v1 机器学习
摘要
议价博弈是一类研究经济行为的重要博弈类型,agent 通过协商决定效用分配方式。本文研究无后悔学习算法在议价博弈中收敛至纳什均衡的条件。近期研究表明,与跟随正则化领导者(Follow the Regularized Leader, FTRL)相关的在线算法在广泛的博弈中(包括零和博弈)能收敛至纳什均衡(NE)。然而,议价博弈缺乏用于建立收敛保证的性质,最简单的 ultimatum game(单次接受或拒绝报价)亦是如此。尽管如此,我们在 mild 假设下证明,FTRL(无需针对零和博弈的修改)在 ultimatum game 中实现对近似 NE 的最后迭代收敛,并给出收敛时间的上界。进一步,我们通过实验结果展示,在 ultimatum game 和多轮议价博弈中,FTRL 能在广泛的初始条件下收敛至 NE(包括非对称报酬的 NE)。本工作表明,复杂的经济行为(如学习使用威胁及众多可能的均衡结果的存在)可从简单学习算法中产生,并且 FTRL 在更为多样化的博弈中收敛至均衡。
引用
@article{arxiv.2507.03150,
title = {Last-Iterate Convergence of No-Regret Learning for Equilibria in Bargaining Games},
author = {Serafina Kamp and Reese Liebman and Benjamin Fish},
journal= {arXiv preprint arXiv:2507.03150},
year = {2025}
}