隐私保护机器学习工作流程:从匿名化到联邦学习中的个性化差分隐私预算
密码学与安全
2026-05-05 v1 人工智能
摘要
人工智能解决方案的日益发展以及隐私立法的推动,催生了所谓的隐私保护机器学习架构,如联邦学习(federated learning)。尽管联邦学习通过在分布式数据上进行模型训练,防止了数据的共享和集中,但仍面临数据完整性和隐私方面的多个挑战。本文提出了一套针对敏感表格数据的综合隐私保护联邦学习工作流程,包括匿名化和差分隐私技术。我们还引入了客户端漂移(client drift)的概念,提供了检测方法以缓解投毒攻击。随后,本文详述了一种基于重新识别风险度量指标,为参与网络的各个客户端分配个性化差分隐私预算的方法。该方法在公开可用的医疗记录数据集上进行了实验测试。实验结果表明,基于个性化预算的方案相较于采用固定差分隐私预算的全局隐私架构,在两个错误度量指标上可实现更好的模型性能。
引用
@article{arxiv.2605.02372,
title = {Privacy Preserving Machine Learning Workflow: from Anonymization to Personalized Differential Privacy Budgets in Federated Learning},
author = {Judith Sáinz-Pardo Díaz and Álvaro López García},
journal= {arXiv preprint arXiv:2605.02372},
year = {2026}
}
备注
Accepted at the 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS2026)