中文

面向无线网络的联邦 LLM 微调的通信感知知识蒸馏

机器学习 2025-10-02 v2

摘要

大型语言模型(LLM)的联邦学习( FL)提供了隐私保护方案,使客户端能够在不交换原始数据的情况下,协作微调本地部署的 LLM 或更小的语言模型( SLM)。尽管传统 FL 模型中的参数共享方法解决了诸多技术挑战,但仍存在高通信开销,并难以适应异构模型架构。联邦蒸馏作为通过共享 logits 实现相互知识传递的框架,通常比参数共享方法具有更低的通信开销。然而,由于其高维度,向 LLM 发送 logits 在带宽受限的客户端仍具有挑战性。本文聚焦于实现低通信开销的联邦 LLM 蒸馏。首先,我们提出一种自适应 Top-k logits 选择机制,根据实时通信条件动态稀疏化 logits。随后,为解决自适应稀疏化引入的维度不一致问题,我们设计了自适应 logits 聚合方案,有效缓解了常规零填充方法所引入的人工和无信息输入。最后,为提升蒸馏效果,我们将 LLM 中的 LoRA 适配隐藏层投影纳入蒸馏损失,从而进一步降低通信开销,并提供更丰富的表征。实验结果表明,我们的方案在保持优异性能的同时,有效降低了约 50% 的通信开销。

关键词

引用

@article{arxiv.2509.01750,
  title  = {Communication-Aware Knowledge Distillation for Federated LLM Fine-Tuning over Wireless Networks},
  author = {Xinlu Zhang and Na Yan and Yang Su and Yansha Deng and Toktam Mahmoodi},
  journal= {arXiv preprint arXiv:2509.01750},
  year   = {2025}
}

备注

accepted by Globecom 2025