中文

ProtegoFed:基于频域梯度的无后门式联合指令调优

密码学与安全 2026-03-03 v1

摘要

联合指令调优(FIT)使大语言模型能够在无需共享私有指令的情况下跨多个组织(客户端)进行协作式指令调优。近期关于自然后门及现有训练数据收集方法的发现表明,受感染样本可能普遍存在且无意被嵌入真实数据集中,甚至可能分布在所有客户端上,尽管这些客户端是良性的。这项工作系统性地检验了 FIT 中的这一威胁,表明当受感染数据在所有客户端中被随机分布时,现有的防御措施无法有效工作。解决这一挑战需要克服两个主要难题:在每个客户端识别受感染样本的独特特征,以及在部分客户端被大量受感染数据主导的情况下实现协作防御。为此,我们识别出频域梯度作为区分受感染数据可靠的信号。进一步提出全局二次聚类机制,以促进跨客户端受感染样本的协作识别。总而言之,本文引入 ProtegoFed 框架,首个实现在训练期间准确检测、移除甚至纯化所有客户端中随机分布的受感染数据的无后门式 FIT 框架。实验在四个 FL 数据集上进行,结果表明 ProtegoFed 可识别 92.00%~100.00% 的受感染样本,将攻击成功率降至接近零,并在主任务上保持性能。代码已公开于 https://github.com/dongdongzhaoUP/ProtegoFed。

关键词

引用

@article{arxiv.2603.00516,
  title  = {ProtegoFed: Backdoor-Free Federated Instruction Tuning with Interspersed Poisoned Data},
  author = {Haodong Zhao and Jinming Hu and Zhaomin Wu and Zongru Wu and Wei Du and Junyi Hou and Caibei Zhao and Zhuosheng Zhang and Bingsheng He and Gongshen Liu},
  journal= {arXiv preprint arXiv:2603.00516},
  year   = {2026}
}

备注

Work in progress