中文

将反事实影响视为分布量

机器学习 2025-06-26 v1 人工智能 计算与语言 密码学与安全

摘要

机器学习模型已知会记忆其训练数据的样本,引发关于隐私和泛化的担忧。反事实自影响是一种流行的度量方法,用于研究记忆,量化模型对样本的预测如何取决于该样本是否包含在训练数据集中。然而,最近的工作表明,记忆受影响不仅限于自影响,其他训练样本(尤其是近似重复样本)也具有显著影响。我们在此研究中将反事实影响视为分布量,考虑所有训练样本如何影响样本的记忆。对于一个小型语言模型,我们计算了训练样本之间完整的影响分布并分析其属性。我们发现,仅关注自影响会严重低估与记忆相关的实际风险:近似重复样本的存在严重降低了自影响,而我们发现这些样本是可提取的。我们在图像分类中观察到类似模式,其中仅通过影响分布即可揭示CIFAR-10中近似重复样本的存在。我们的发现表明,记忆源于训练数据之间的复杂相互作用,由完整的影响分布而非自影响alone能够更好地捕获。

关键词

引用

@article{arxiv.2506.20481,
  title  = {Counterfactual Influence as a Distributional Quantity},
  author = {Matthieu Meeus and Igor Shilov and Georgios Kaissis and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2506.20481},
  year   = {2025}
}

备注

Workshop on The Impact of Memorization on Trustworthy Foundation Models (MemFM) @ ICML 2025