去中心化学习对 Stackelberg 博弈中参与者效用的影响
机器学习
2024-06-24 v2 计算机科学与博弈论
摘要
当部署于现实世界时,学习智能体(如推荐系统或聊天机器人)通常会随时间反复与另一个学习智能体(如用户)交互。在许多此类双智能体系统中,每个智能体单独学习,且两者的奖励并非完全一致。为了更好地理解此类情况,我们考察了双智能体系统的学习动态及其对每个智能体目标的影响。我们将这些系统建模为具有去中心化学习的 Stackelberg 博弈,并表明标准遗憾基准(如 Stackelberg 均衡收益)会导致至少一名参与者出现最坏情况下的线性遗憾。为了更好地捕捉这些系统,我们构建了一个对智能体微小学习误差具有容忍度的松弛遗憾基准。我们表明标准学习算法无法提供次线性遗憾,并开发了针对这些基准为双方参与者实现近最优 遗憾的算法。我们进一步设计了松弛环境,使得更快的学习()成为可能。总之,我们的结果迈出了评估顺序和去中心化学习环境中双智能体交互如何影响双方参与者效用的一步。
引用
@article{arxiv.2403.00188,
title = {Impact of Decentralized Learning on Player Utilities in Stackelberg Games},
author = {Kate Donahue and Nicole Immorlica and Meena Jagadeesan and Brendan Lucier and Aleksandrs Slivkins},
journal= {arXiv preprint arXiv:2403.00188},
year = {2024}
}
备注
To appear at ICML 2024; this is the full version