中文

TablePuppet:关系联邦学习的通用框架

机器学习 2024-03-26 v1 数据库 分布式、并行与集群计算

摘要

当前的联邦学习(FL)方法将分散的训练数据视为单个表格,按行(水平)或按列(垂直)在参与者之间划分。然而,这些方法不足以处理跨数据库的分布式关系表。这种情况需要复杂的SQL操作(如连接和并集)来获取训练数据,这要么成本高昂,要么受隐私限制。这引发了一个问题:我们能否直接在分布式关系表上运行FL?在本文中,我们将此问题形式化为关系联邦学习(RFL)。我们提出了TablePuppet,一个通用的RFL框架,将学习过程分解为两个步骤:(1)连接上的学习(LoJ),随后是(2)并集上的学习(LoU)。简而言之,LoJ将学习下推到被连接的垂直表上,LoU进一步将学习下推到每个垂直表的水平分区上。TablePuppet结合了计算/通信优化来处理连接引入的重复元组,以及差分隐私(DP)来防止特征和标签泄露。我们展示了TablePuppet与两种广泛使用的机器学习训练算法——随机梯度下降(SGD)和交替方向乘子法(ADMM)——结合时的效率,并比较了它们的计算/通信复杂度。我们通过训练多种机器学习模型来评估基于TablePuppet开发的SGD/ADMM算法。实验结果表明,TablePuppet实现了与直接基于SQL结果的集中式基线相当的模型精度。此外,ADMM在收敛到相似模型精度时所需的通信时间少于SGD。

关键词

引用

@article{arxiv.2403.15839,
  title  = {TablePuppet: A Generic Framework for Relational Federated Learning},
  author = {Lijie Xu and Chulin Xie and Yiran Guo and Gustavo Alonso and Bo Li and Guoliang Li and Wei Wang and Wentao Wu and Ce Zhang},
  journal= {arXiv preprint arXiv:2403.15839},
  year   = {2024}
}

备注

14 pages, 8 figures