引导无后悔学习者为达到期望均衡
计算机科学与博弈论
2026-03-18 v5
摘要
一个中介者观察到无后悔学习者在 轮中重复进行一个扩展式博弈。中介者试图通过向参与者提供(非负)支付来引导参与者走向某个期望的预定均衡。我们称此为引导问题。引导问题涵盖若干令人关注的问题,其中包括均衡选择和信息设计(劝说)。如果中介者的预算无界,引导是平凡的,因为中介者只需支付参与者以使其采取期望的行动。我们研究对中介者支付的两种约束:总预算和每轮预算。如果中介者的总预算不随 增长,我们证明引导是不可能的。然而,我们证明总预算只需以亚线性于 的速度增长,即平均支付趋于零,便足以引导。当每轮观察到参与者的完整策略时,我们证明常数的每轮预算允许引导。在更具挑战性的仅可观测博弈树轨迹的设置中,我们证明在一般扩展式博弈中常数的每轮预算下引导是不可能的,但在正规式博弈中或若每轮预算本身可依赖于 时是可能的。我们还展示了我们的结果如何推广到均衡在引导过程中被在线计算的情形。我们以突出在大型博弈中引导有效性的实验补充了我们的理论正向结果。
引用
@article{arxiv.2306.05221,
title = {Steering No-Regret Learners to a Desired Equilibrium},
author = {Brian Hu Zhang and Gabriele Farina and Ioannis Anagnostides and Federico Cacciamani and Stephen Marcus McAleer and Andreas Alexander Haupt and Andrea Celli and Nicola Gatti and Vincent Conitzer and Tuomas Sandholm},
journal= {arXiv preprint arXiv:2306.05221},
year = {2026}
}