中文

安全联邦数据蒸馏

密码学与安全 2025-03-07 v2 人工智能

摘要

数据集蒸馏(DD)是一项强大的技术,可将大型数据集缩减为紧凑且具代表性的合成数据集,从而加速机器学习训练。然而,传统的 DD 方法以集中式方式运行,这带来了重大的隐私威胁并降低了其适用性。为了降低这些风险,我们提出了一种安全联邦数据蒸馏(SFDD)框架,以在保护隐私的同时分散蒸馏过程。现有的联邦蒸馏技术侧重于利用蒸馏出的知识训练全局模型,与此不同,我们的方法旨在生成蒸馏数据集而不暴露本地贡献。我们利用基于梯度匹配的蒸馏方法,并将其适配于分布式环境,在此环境中客户端参与蒸馏过程而无需共享原始数据。中央聚合器通过整合客户端更新来迭代优化合成数据集,同时确保数据机密性。为了使我们的方法能够抵御服务器可能利用梯度更新重构私有数据而发起的推理攻击,我们创建了一种优化的本地差分隐私方法,称为 LDPO-RLD。此外,我们评估了该框架针对执行后门攻击(如 Doorping)的恶意客户端的抵御能力,并证明了在参与客户端数量充足的假设下具有鲁棒性。我们的实验结果证明了 SFDB 的有效性,并且所提出的防御措施切实缓解了已识别的漏洞,对蒸馏数据集的性能影响极小。通过解决数据集蒸馏中隐私与联邦之间的相互作用,这项工作推进了隐私保护机器学习领域的发展,使我们的 SFDB 框架成为敏感数据共享应用的可行解决方案。

关键词

引用

@article{arxiv.2502.13728,
  title  = {Secure Federated Data Distillation},
  author = {Marco Arazzi and Mert Cihangiroglu and Serena Nicolazzo and Antonino Nocera},
  journal= {arXiv preprint arXiv:2502.13728},
  year   = {2025}
}