Stackelberg 博弈中的无悔学习及其在电动网约车中的应用
系统与控制
2025-12-11 v3 计算机科学与博弈论
系统与控制
摘要
我们考虑在领导者缺乏下层博弈知识时,高效学习进行单领导者多跟随者 Stackelberg 博弈的问题。此类博弈产生于涉及自利智能体的层次化决策问题中。例如,在电动网约车市场中,中央权威机构旨在学习最优充电价格,以塑造网约车公司的车队分布和充电模式。现有工作通常应用基于梯度的方法来寻找领导者的最优策略。此类方法不切实际,因为它们要求跟随者与领导者共享私有效用信息。相反,我们将下层博弈视为黑盒,仅假设跟随者的交互近似于 Nash 均衡,而领导者观察由此产生的近似所实现的成本。在领导者成本函数的基于核的正则性假设下,我们开发了一种无悔算法,该算法在 轮内收敛到 -Stackelberg 均衡。最后,我们通过电动网约车市场中最优定价的数值案例研究验证了我们的方法。
引用
@article{arxiv.2504.03745,
title = {No-Regret Learning in Stackelberg Games with an Application to Electric Ride-Hailing},
author = {Anna Maddux and Marko Maljkovic and Nikolas Geroliminis and Maryam Kamgarpour},
journal= {arXiv preprint arXiv:2504.03745},
year = {2025}
}
备注
8 pages, 2 figures, 1 table