中文

无先验、无泄漏:重新审视训练神经网络中的重建攻击

机器学习 2025-09-26 v1 人工智能 机器学习

摘要

神经网络对训练数据的记忆引发了关于隐私和安全的迫切关切。最近的研究表明,在某些条件下,训练集的部分内容可直接从模型参数中被重建。一些方法利用对边际最大化的隐式偏好,这表明一些通常被视为有益于泛化的性质,实际上可能削弱隐私。尽管已有显著的实证演示,但这些攻击的可靠性仍不为人所了解,缺乏坚实的理论基础。在本文中,我们采取一种互补视角:而非设计更强的攻击,我们分析现有重建方法内在的弱点和局限,确定其失效的条件。我们严格证明,在不 incorporating 对数据的先验知识的情况下,存在无数替代解,这些解可能与真实训练集相距甚远,使重建从根本上不可靠。实验上,我们进一步演示,仅凭偶然情况即可完全复制训练实例。我们的结果细化了训练集泄漏可能发生的理论理解,并为缓解重建攻击提供新见解。令人惊讶的是,我们展示,训练得更充分的网络——因此更强地满足隐式偏好条件——实际上对重建攻击更不易受攻击,这在该情境下实现了隐私与强泛化需求的调和。

关键词

引用

@article{arxiv.2509.21296,
  title  = {No Prior, No Leakage: Revisiting Reconstruction Attacks in Trained Neural Networks},
  author = {Yehonatan Refael and Guy Smorodinsky and Ofir Lindenbaum and Itay Safran},
  journal= {arXiv preprint arXiv:2509.21296},
  year   = {2025}
}