中文

使用集成私有模型的概念漂移检测

机器学习 2024-06-10 v1 密码学与安全

摘要

深度神经网络 (DNN) 是最广泛使用的机器学习算法之一。DNN 需要事先获取带有真实标签的训练数据。对于许多实际问题而言,这在数据以流式形式到达且获取真实标签稀缺且昂贵的情况下是不可行的。在文献中,针对流式数据的隐私前景几乎未受到关注,而数据分布可能频繁变化。这些概念漂移必须以私有方式检测,以避免 DNN 泄露风险。现有的隐私模型使用诸如 ADWIN、KSWIN 等概念漂移检测方案。在本文中,我们关注集成私有 DNN 的概念漂移检测。集成私有 DNN 是指来自不同数据集的模型具有高度相似性。基于此,我们引入一种称为'集成私有漂移检测' (IPDD) 的集成方法,用于从私有模型中检测概念漂移。我们的 IPDD 方法无需标签即可检测漂移,但假设在检测到漂移后可获取真实标签。我们对二进制和多类合成数据和真实数据进行了实验。我们的实验结果表明,该方法能够以可比的效用(在某些情况下甚至更好)私有地检测概念漂移,优于不同程度的差分隐私模型。论文的源代码在此处提供。

关键词

引用

@article{arxiv.2406.04903,
  title  = {Concept Drift Detection using Ensemble of Integrally Private Models},
  author = {Ayush K. Varshney and Vicenc Torra},
  journal= {arXiv preprint arXiv:2406.04903},
  year   = {2024}
}

备注

Accepted for publication in MLCS co-located with ECML-PKDD 2023