中文

SoK:机器学习中的记忆化

机器学习 2023-11-07 v1 密码学与安全 信息论 math.IT

摘要

量化个体数据样本对机器学习模型的影响是一个开放的研究问题。当需从数据生成分布的有限样本中学习复杂高维关系(如深度学习)时,这一点尤为相关。先前研究表明,在此类情形下,模型不仅依赖提取有助于泛化的模式,似乎还不得不或多或少按原样纳入部分训练数据,这一过程常被称为记忆化(memorisation)。这引出一个问题:若某些记忆化是有效学习的必要条件,其隐私含义为何?本工作统一了机器学习中记忆化的广泛先前定义与视角,讨论其与模型泛化的相互作用及这些现象对数据隐私的影响。此外,我们系统化使从业者能检测记忆化发生或量化它的方法,并将发现置于广泛的机器学习设置中。最后,我们在隐私攻击、差分隐私(DP)与对抗行为者的背景下讨论记忆化。

关键词

引用

@article{arxiv.2311.03075,
  title  = {SoK: Memorisation in machine learning},
  author = {Dmitrii Usynin and Moritz Knolle and Georgios Kaissis},
  journal= {arXiv preprint arXiv:2311.03075},
  year   = {2023}
}