通过有限数据验证使随机_bandit免受投毒攻击
机器学习
2022-05-05 v2 人工智能
密码学与安全
机器学习
摘要
我们研究有界奖励设定下受数据投毒攻击的 bandit 算法。我们考虑一种强攻击者模型,其中攻击者可以观测所选动作及其对应奖励,并可用加性噪声污染奖励。我们证明任何具有 后悔的 bandit 算法都可被迫使承受 的后悔,而期望污染量为 。该污染量也是必要的,因为我们证明存在一个 后悔的 bandit 算法(具体地,经典 UCB)需要 的污染量才会遭受 的后悔。为抵御此类攻击,我们的第二个主要贡献是提出基于验证的机制,其利用有限验证来访问有限数量未受污染的奖励。特别地,对于无限验证的情形,我们证明以 的期望验证次数,一种简单修改的 ETC 类 bandit 算法可恢复阶最优的 后悔,而与攻击者使用的污染量无关。我们还提供一种类 UCB 的验证方案,称为 Secure-UCB,它也能从任何攻击中完全恢复,同样只需 期望验证次数。为推导验证次数的匹配下界,我们证明对于任何阶最优 bandit 算法,要恢复阶最优后悔,此 验证次数是必要的。另一方面,当验证次数以上界预算 受限时,我们提出一种新算法 Secure-BARBAR,它在面对弱攻击者时以高概率可证明地实现 后悔,其中 为攻击者的总污染量;若 较大,这打破了非验证设定下已知的 下界。
引用
@article{arxiv.2102.07711,
title = {Saving Stochastic Bandits from Poisoning Attacks via Limited Data Verification},
author = {Anshuka Rangi and Long Tran-Thanh and Haifeng Xu and Massimo Franceschetti},
journal= {arXiv preprint arXiv:2102.07711},
year = {2022}
}
备注
Accepted to AAAI 2022