中文

超越参数聚合:面向大语言模型联邦微调的语义共识

机器学习 2026-05-13 v1

摘要

大语言模型的联邦微调通常被表述为一个参数聚合问题。然而,即使是参数高效的方法也需要传输大量可训练权重,假设架构对齐,并依赖于对模型参数的白盒访问。随着模型规模持续增长和部署日益异构化,这些假设与实际的约束条件越来越不匹配。我们考虑一种替代方案,其中协作通过模型行为而非参数进行中介。客户端在私有数据上微调本地模型,并在共享的公共提示集上交换生成的输出。服务器将这些输出映射到语义表示空间,形成每个提示的语义共识,并返回伪标签以供进一步的本地微调。这种方案从根本上改变了联邦大语言模型微调的通信规模。交换的信息量仅取决于公共提示预算和所通信行为的大小,与模型规模无关。因此,该协议自然地适应异构架构,并直接适用于开放式文本生成。我们提出的理论分析和实证结果表明,这种方法可以匹配强大的联邦微调基线,同时将通信量大幅减少数个数量级(例如,对于Llama3.1-405B,分析显示减少了1006倍),并降低了运行时间和能耗。这些结果表明,对于生成式基础模型,行为级共识为联邦适配提供了比参数聚合更合适的抽象。

关键词

引用

@article{arxiv.2605.11857,
  title  = {Beyond Parameter Aggregation: Semantic Consensus for Federated Fine-Tuning of LLMs},
  author = {Amr Abourayya and Jens Kleesiek and Michael Kamp},
  journal= {arXiv preprint arXiv:2605.11857},
  year   = {2026}
}