中文

课程学习中隐私风险的综合研究

密码学与安全 2023-10-17 v1 机器学习

摘要

以有意义的顺序(即从易到难)使用数据训练机器学习模型,已被证明能有效加速训练过程并取得更好的模型性能。其关键技术为课程学习(CL),该技术在图像与文本分类等领域取得了巨大成功并得以部署。然而,CL 如何影响机器学习的隐私尚不清楚。鉴于 CL 改变了模型记忆训练数据的方式,其对数据隐私的影响需被彻底评估。为填补这一知识空白,我们开展了首项研究,并利用成员推断攻击(MIA)与属性推断攻击(AIA)作为两种途径来量化 CL 引起的隐私泄露。我们对九个真实数据集结合攻击方法(基于神经网络的、基于度量的、仅标签 MIA,以及基于神经网络的 AIA)的评估揭示了关于 CL 的新见解。首先,应用 CL 后 MIA 略微更有效,但对被评级为困难的那部分训练样本影响尤为显著。其次,与 MIA 相比,CL 下训练的模型在 AIA 下更不易受攻击。第三,现有的防御技术如 DP-SGD、MemGuard 和 MixupMMD 在 CL 下仍然有效,尽管 DP-SGD 对目标模型精度有显著影响。最后,基于我们对 CL 的见解,我们提出了一种称为 Diff-Cali 的新 MIA,其利用难度分数进行结果校准,并被证明对所有 CL 方法和常规训练方法均有效。通过本研究,我们希望引起社区对新兴机器学习技术非预期隐私风险的关注,并开发新的攻击基准与防御方案。

关键词

引用

@article{arxiv.2310.10124,
  title  = {A Comprehensive Study of Privacy Risks in Curriculum Learning},
  author = {Joann Qiongna Chen and Xinlei He and Zheng Li and Yang Zhang and Zhou Li},
  journal= {arXiv preprint arXiv:2310.10124},
  year   = {2023}
}