中文

固定预算下的差分隐私最佳臂识别

机器学习 2024-01-18 v1 人工智能 信息论 math.IT 统计理论 机器学习 统计理论

摘要

我们在差分隐私约束下,研究奖励支撑在单位区间内的线性 bandit 在固定预算制度下的最佳臂识别(BAI)问题。给定有限预算 TT 和隐私参数 ε>0\varepsilon>0,目标是在满足决策者策略符合特定 {\em ε\varepsilon-差分隐私}(ε\varepsilon-DP)约束的前提下,最小化在 TT 轮采样后找到具有最大均值臂的错误概率。我们通过提出{\em 最大绝对行列式}原则,构建了一个满足 ε\varepsilon-DP 约束的策略(称为 {\sc DP-BAI}),并推导了其错误概率的上界。此外,我们推导了错误概率的极小极大下界,并证明上下界随 TT 呈指数衰减,且两个界中的指数在以下方面阶数匹配:(a) 臂的次优间隙,(b) ε\varepsilon,以及 (c) 问题复杂度,该复杂度可表示为两项之和,一项表征标准固定预算 BAI(无隐私约束)的复杂度,另一项考虑 ε\varepsilon-DP 约束。此外,我们提出了一些辅助结果,有助于推导错误概率的下界。我们认为这些结果可能具有独立兴趣,并可用于证明其他多种 bandit 问题中的错误概率下界。虽然先前的工作提供了无隐私约束的固定预算制度下或有隐私约束的固定置信度制度下的 BAI 结果,但我们的工作填补了文献空白,提供了 ε\varepsilon-DP 约束下固定预算制度中 BAI 的结果。

关键词

引用

@article{arxiv.2401.09073,
  title  = {Fixed-Budget Differentially Private Best Arm Identification},
  author = {Zhirui Chen and P. N. Karthik and Yeow Meng Chee and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2401.09073},
  year   = {2024}
}

备注

Accepted to ICLR 2024