关于私有且鲁棒的多臂赌博机
机器学习
2023-03-07 v2 人工智能
密码学与安全
机器学习
摘要
我们研究了私有且鲁棒的多臂赌博机(MAB),其中智能体接收Huber污染的重尾奖励,同时需要确保差分隐私。我们首先给出了其极小极大下界,刻画了关于隐私预算、污染程度和重尾性的遗憾的信息论极限。然后,我们提出了一种元算法,该算法构建于一个私有且鲁棒的均值估计子程序 \texttt{PRM} 之上,该子程序本质上仅依赖于奖励截断和拉普拉斯机制。针对两种不同的重尾设定,我们给出了 \texttt{PRM} 的具体方案,这使我们能够实现近乎最优的遗憾。作为我们主要结果的副产品,我们也首次给出了私有重尾MAB(即无污染情况)的极小极大下界。此外,我们提出的两种基于截断的 \texttt{PRM} 实现了估计精度、隐私和鲁棒性之间的最优权衡。最后,我们通过实验研究支持了我们的理论结果。
引用
@article{arxiv.2302.02526,
title = {On Private and Robust Bandits},
author = {Yulian Wu and Xingyu Zhou and Youming Tao and Di Wang},
journal= {arXiv preprint arXiv:2302.02526},
year = {2023}
}