中文

面向差分隐私联邦学习的高效语言模型架构

机器学习 2024-03-14 v1 密码学与安全 分布式、并行与集群计算

摘要

跨设备联邦学习是一种在数据分布于通常数百万边缘设备上且数据不离开设备的情况下训练模型的技术。SGD是跨设备联邦学习中设备端训练的标准客户端优化器,因其内存和计算效率而受到青睐。然而,在神经语言模型的集中式训练中,自适应优化器因其提供的改进稳定性和性能而更受偏好。鉴于此,我们探讨了是否可以修改语言模型,使其能够使用SGD客户端优化器进行高效训练,并对此给出了肯定的回答。我们通过修改循环单元中的sigmoid和tanh激活函数,提出了一种尺度不变的耦合输入遗忘门循环网络,并在大规模实验中证明,在跨设备联邦学习中,这种新模型比标准CIFG循环模型收敛更快,且效用更好。我们进一步证明,所提出的尺度不变修改也有助于更大Transformer模型的联邦学习。最后,我们展示了尺度不变修改也与其他非自适应算法兼容。特别是,我们的结果表明,在具有差分隐私的联邦学习中,隐私与效用的权衡得到了改善。

关键词

引用

@article{arxiv.2403.08100,
  title  = {Efficient Language Model Architectures for Differentially Private Federated Learning},
  author = {Jae Hun Ro and Srinadh Bhojanapalli and Zheng Xu and Yanxiang Zhang and Ananda Theertha Suresh},
  journal= {arXiv preprint arXiv:2403.08100},
  year   = {2024}
}