FedFrozen:基于注意力核冻结的两阶段联邦优化
机器学习
2026-05-08 v1
摘要
带异构客户端的联邦学习是深度学习中的重大挑战,主要由于来自不一致本地更新的客户端漂移所致。现有联邦优化方法通常通过目标级正则化或更新纠错机制来解决此问题。然而,近期研究表明,Transformer-based架构在异构联邦训练下可能天然比常规模型更鲁棒。为此,我们研究注意力机制中不同参数组件对联邦优化的影响。具体而言,将注意力模块分解为决定注意力核的查询/键块与在所诱导核下执行语义转换的值块。基于此视角,我们提出FedFrozen:一个两阶段联邦优化框架,首先进行全模型热身训练,然后冻结查询/键块持续优化值块。在线性注意力表述下,我们展示热身阶段可解释为对正则化核配置目标的近似下降过程,而冻结阶段则化简为在固定注意力核下的值块受限优化问题。我们的分析进一步揭示了热身长度选择的显式权衡。仿真验证了预测的偏差-漂移行为,真实数据实验表明FedFrozen提升了Transformer模型在异构联邦学习中的稳定性与有效性。
引用
@article{arxiv.2605.06446,
title = {FedFrozen: Two-Stage Federated Optimization via Attention Kernel Freezing},
author = {Junye Du and Zhenghao Li and Yushi Feng and Long Feng},
journal= {arXiv preprint arXiv:2605.06446},
year = {2026}
}
备注
25 pages