中文

鲁棒对抗破坏的随机多臂老虎机

机器学习 2018-03-28 v1 数据结构与算法 计算机科学与博弈论 机器学习

摘要

我们引入了一种带有对抗破坏的随机多臂老虎机新模型,旨在捕捉大多数输入遵循随机模式但其中一部分可被对抗性修改以欺骗算法的场景,例如点击欺诈、虚假评论和电子邮件垃圾信息。该模型的目标是鼓励设计这样的多臂老虎机算法: 在混合对抗与随机模型中均表现良好; 其性能在从完全随机模型向完全对抗模型过渡时优雅下降。在我们的模型中,所有臂的奖励初始抽取自一个分布,随后被自适应对手修改。我们提供了一种简单的算法,其性能随对手注入数据中的总破坏量优雅下降,该总破坏量以各轮中对手对数据最大修改量的跨轮总和来衡量,记为 CC。我们的算法提供了如下保证:若输入是随机的,则保留最优保证(至多相差一个对数项);且其性能随破坏量 CC 线性下降,同时关键在于对该破坏量是不可知的。我们还提供了一个下界,表明若算法在随机设置下达到最优性能,则这种线性下降是必要的(该下界即便在已知破坏量的情况下也成立,而在此特殊情况下,我们的算法无需额外的对数项即可达到最优性能)。

关键词

引用

@article{arxiv.1803.09353,
  title  = {Stochastic bandits robust to adversarial corruptions},
  author = {Thodoris Lykouris and Vahab Mirrokni and Renato Paes Leme},
  journal= {arXiv preprint arXiv:1803.09353},
  year   = {2018}
}

备注

To appear in STOC 2018