构建面向科学 AI 的企业级隐私保护性联邦学习框架的经验
分布式、并行与集群计算
2025-11-13 v1
摘要
联邦学习 (Federated Learning, FL) 是一种在不进行集中化数据共享的情况下实现协作模型训练的有前景的方法,这在数据隐私、所有权和合规性约束至关重要的科学领域中尤为重要。然而,构建既可扩展又隐私保护的用户友好型企业级联邦学习框架仍然具有挑战性,尤其是在将本地原型设计与跨异构客户端计算基础设施的分布式部署之间的鸿沟。本文基于我们构建“高级隐私保护性联邦学习” (Advanced Privacy-Preserving Federated Learning, APPFL) 框架的经验,提出了一种面向企业的隐私保护性联邦学习框架,以实现跨计算环境的无缝扩展。我们识别出该框架必须提供的几个关键能力:(1) 可扩展的本地仿真与原型设计,以加速实验和算法设计;(2) 从仿真到部署的无缝过渡;(3) 跨多样化真实基础设施的分布式部署,从个人设备到云端集群及高性能计算系统;(4) 在易用性与研究灵活性之间进行多层次抽象;(5) 通过差分隐私、安全聚合、健壮身份验证和保密计算等技术实现全面的隐私与安全。我们进一步讨论了实现这些目标的架构设计。该框架旨在弥合研究原型与企业级部署之间的差距,实现面向科学的可扩展、可靠且隐私保护的 AI。
引用
@article{arxiv.2511.08998,
title = {Experiences Building Enterprise-Level Privacy-Preserving Federated Learning to Power AI for Science},
author = {Zilinghan Li and Aditya Sinha and Yijiang Li and Kyle Chard and Kibaek Kim and Ravi Madduri},
journal= {arXiv preprint arXiv:2511.08998},
year = {2025}
}