中文

针对上下文_bandit的协同攻击:基本极限与防御机制

机器学习 2022-02-01 v1 密码学与安全 信息论 math.IT 机器学习

摘要

受在线推荐系统启发,我们提出了在多任务上下文_bandit中寻找最优策略的问题,其中一小部分比例 α<1/2\alpha < 1/2 的任务(用户)是任意且对抗性的。剩余的好用户共享同一个具有 SS 个上下文和 AA 个动作(物品)的上下文_bandit实例。自然地,用户是好的还是对抗性的事先未知。目标是以尽可能少的用户交互鲁棒地学习最大化好用户奖励的策略。在没有对抗用户的情况下,协同过滤的既有结果表明每个用户 O(1/ϵ2)O(1/\epsilon^2) 次交互足以学习一个好的策略, precisely because information can be shared across users。这种并行化收益被对抗用户的存在从根本上改变:除非有超多项式数量的用户,我们证明好用户学习一个 ϵ\epsilon-最优策略需要每个用户 Ω~(min(S,A)α2/ϵ2)\tilde{\Omega}(\min(S,A) \cdot \alpha^2 / \epsilon^2) 次交互的下界。然后我们展示可以通过对单变量和高维随机变量采用高效的鲁棒均值估计器达到 O~(min(S,A)α/ϵ2)\tilde{O}(\min(S,A)\cdot \alpha/\epsilon^2) 的上界。我们还展示这可以根据上下文的分布得到改进。

关键词

引用

@article{arxiv.2201.12700,
  title  = {Coordinated Attacks against Contextual Bandits: Fundamental Limits and Defense Mechanisms},
  author = {Jeongyeol Kwon and Yonathan Efroni and Constantine Caramanis and Shie Mannor},
  journal= {arXiv preprint arXiv:2201.12700},
  year   = {2022}
}