神经网络的记忆后门攻击
密码学与安全
2025-12-19 v2 计算机视觉与模式识别
机器学习
摘要
神经网络通常在专有数据集上进行训练,因而成为具有吸引力的攻击目标。我们提出了一种新颖的数据提取方法,利用创新的训练时后门攻击,使恶意的联邦学习服务器能够通过简单的索引过程系统性且确定性地提取完整的客户端训练样本。与先前技术不同,我们的方法保证了精确的数据恢复,而不仅仅是概率性重建或幻觉输出,能够对哪些样本被记忆以及记忆多少进行精确控制,并且具有高容量和高鲁棒性。感染模型在接收基于模式的索引触发器时会输出数据样本,从而 enable 对每个客户端本地数据进行有意义的补丁进行系统提取,而不会影响全局模型的实用性。为了解决小模型输出大小的问题,我们提取补丁并将其重新组合。该攻击仅需要对训练代码进行微小的修改,容易在客户端验证期间避免检测。因此,这一漏洞代表了一种现实中的联邦学习供应链威胁,恶意服务器可以向客户端分发修改后的训练代码,随后从它们的更新中恢复私人数据。评估显示,在分类器、分割模型和大型语言模型等任务中,能够以最小的性能影响从客户端模型中恢复数千个敏感训练样本,甚至在多个联邦学习轮次后窃取整个客户端数据集。例如,仅3%的实用性下降即可提取医学分割数据集。这些发现揭示了联邦学习系统中的关键隐私漏洞,强调了分布式训练管道需要更强的完整性和透明度。
引用
@article{arxiv.2411.14516,
title = {Memory Backdoor Attacks on Neural Networks},
author = {Eden Luzon and Guy Amit and Roy Weiss and Torsten Kraub and Alexandra Dmitrienko and Yisroel Mirsky},
journal= {arXiv preprint arXiv:2411.14516},
year = {2025}
}