中文

基于变分自编码器的联邦主题模型与模型剪枝

机器学习 2023-11-02 v1 信息检索

摘要

主题建模已成为在大型文档集合中发现模式与主题的有用工具。然而,当跨多方进行分析时,数据隐私成为关键问题。联邦主题建模应运而生以解决此问题,允许多方在保护隐私的同时联合训练模型。但联邦场景中存在通信与性能挑战。为解决上述问题,本文提出一种在确保各节点隐私的同时建立联邦主题模型的方法,并利用神经网络模型剪枝加速模型,其中客户端周期性地向服务器发送模型神经元累积梯度与模型权重,服务器对模型进行剪枝。为应对不同需求,提出两种确定模型剪枝率的方法。第一种方法在整个模型训练过程中缓慢剪枝,对模型训练过程的加速效果有限,但可确保剪枝后模型达到更高精度,这能显著减少推理过程中的模型推理时间。第二种策略是在模型训练早期快速达到目标剪枝率以加速模型训练速度,之后以更小的模型规模继续训练。该方法可能损失更多有用信息,但能更快完成模型训练。实验结果表明,本文提出的基于变分自编码器的联邦主题模型剪枝能在保证模型性能的同时大幅加速模型训练速度。

关键词

引用

@article{arxiv.2311.00314,
  title  = {Federated Topic Model and Model Pruning Based on Variational Autoencoder},
  author = {Chengjie Ma and Yawen Li and Meiyu Liang and Ang Li},
  journal= {arXiv preprint arXiv:2311.00314},
  year   = {2023}
}

备注

8 pages