中文

基于图表示学习的联邦细调大语言模型的模型操纵增强方法

机器学习 2026-05-11 v1 密码学与安全 网络与互联网体系结构

摘要

联邦细调(FFT)已成为一种保护隐私的范式,用于协作调整大语言模型(LLMs)。基于联邦学习,FFT使分布式代理能够在不共享本地原始数据的情况下,聚合局部LLM更新以细化共享预训练LLM。然而,基于FFT的LLMs仍然面临模型操纵威胁,即恶意参与者上传被操纵的LLM更新,以破坏聚合过程并降低全局LLM性能。本文提出一种针对FFT-based LLMs的增强模型操纵(AugMP)策略。具体而言,我们设计了一个捕获 benign LLM 更新之间特征相关性的图表示学习框架,以指导恶意更新的生成。为增强操纵的有效性和隐蔽性,我们开发了基于增广拉格朗日对偶 formulation 的迭代操纵算法。通过该 formulation,恶意更新被优化以嵌入对抗性目标,同时保持类似 benign 参数特征。实验结果表明,AugMP策略在所有竞争基线中实现了最强的操纵性能,将全局LLM准确率下降最高可达26%,将局部LLM代理的平均准确率降低最高可达22%。同时,AugMP在统计和几何一致性方面保持良好,能够有效避免常规基于距离和相似性的防御方法。

关键词

引用

@article{arxiv.2605.07961,
  title  = {Graph Representation Learning Augmented Model Manipulation on Federated Fine-Tuning of LLMs},
  author = {Hanlin Cai and Kai Li and Houtianfu Wang and Haofan Dong and Yichen Li and Falko Dressler and Ozgur B. Akan},
  journal= {arXiv preprint arXiv:2605.07961},
  year   = {2026}
}