中文

探索代价与搭便车不公平性的量化研究

机器学习 2022-02-07 v5 多智能体系统 机器学习

摘要

我们考虑一种带有变化的多臂老虎机设定。与仅有一个决策者在每轮决定拉哪只臂不同,我们有 nn 个不同的决策者(智能体)。在简单随机设定下,我们表明一个观察另一个“自立”智能体的“搭便车”智能体可以仅获得 O(1)O(1) 后悔值,而当一个决策者单独行动时后悔值的下界为 Ω(logt)\Omega (\log t)。当自立智能体的策略满足以下两个假设之一时,该结果成立:(1) 每只臂在期望中被拉至少 γlnt\gamma \ln t 次,其中 γ\gamma 是我们计算出的常数,或 (2) 自立智能体以高概率实现 o(t)o(t) 的实际后悔值。这两个假设都被标准的零后悔算法所满足。在第二个假设下,我们进一步表明搭便车者只需观察自立智能体拉每只臂的次数,而无需观察实现的奖励。在线性上下文设定中,每只臂在参数向量上有一个分布,每个智能体有一个上下文向量,当智能体拉一只臂时实现的奖励是该智能体的上下文向量与从被拉臂的分布中采样的参数向量的内积。我们表明,当搭便车者的上下文是其他智能体上下文的一个小的(L2L_2 范数意义下)线性组合,且所有其他智能体以高概率将每只臂拉 Ω(logt)\Omega (\log t) 次时,搭便车者可以在此设定中实现 O(1)O(1) 后悔值。同样,对自立参与者的这一条件由诸如 UCB 的标准零后悔算法所满足。我们还证明了一些下界。

关键词

引用

@article{arxiv.1810.08743,
  title  = {Quantifying the Burden of Exploration and the Unfairness of Free Riding},
  author = {Christopher Jung and Sampath Kannan and Neil Lutz},
  journal= {arXiv preprint arXiv:1810.08743},
  year   = {2022}
}