中文

不可知离线随机多臂老虎机问题

机器学习 2026-05-04 v1 数据结构与算法

摘要

机器不可知旨在从已学习的模型中忘却数据点,为处理数据删除请求并在不进行完整再训练的情况下缓解隐私风险提供了原则性方法。先前的工作主要研究了无监督/监督机器不可知,对于序列决策系统的不可知研究则鲜有了解。我们首次针对基础序列决策问题——离线随机多臂老虎机(MAB)——开展研究。我们为离线 MAB 形式化隐私约束,并以事后不可知决策质量作为效用度量。我们系统研究了单源和多源不可知场景,分别基于固定样本模型和分布模型。在这些设置下,我们的算法设计基于两个标准基线算法:高斯机制和回滚,并提出根据数据场景和隐私约束切换使用的自适应算法。我们进一步引入混合程序,以阐明这些基线方法背后的逻辑。我们在上述所有设置下都提供了性能保证,并在两种数据集模型下建立了下界。实验验证了预测的权衡关系,并展示了所提方法的有效性。

关键词

引用

@article{arxiv.2605.00638,
  title  = {Unlearning Offline Stochastic Multi-Armed Bandits},
  author = {Zichun Ye and Runqi Wang and Xuchuang Wang and Xutong Liu and Shuai Li and Mohammad Hajiesmaili},
  journal= {arXiv preprint arXiv:2605.00638},
  year   = {2026}
}

备注

First two authors made an equal contribution