中文

去中心化后训练中的后门攻击

密码学与安全 2026-04-06 v1 机器学习

摘要

去中心化后训练大型语言模型利用数据和管道并行技术将数据和模型分割。然而,去中心化后训练可能因恶意参与者进行投毒和后门攻击而受到威胁。目前关于抗御去中心化数据并行或联邦学习攻击和防御的工作已有所述,但针对管道并行鲁活性的现有工作仅限于投毒攻击。本文在我们设定下,控制管道的中间阶段而非整个模型或数据集,使现有攻击如数据投毒无法适用。我们的实验结果表明,即使是受限的攻击者也能注入后门并在后训练期间导致模型失去对齐,独立于所学习的领域或数据集。我们的攻击使触发词的包含率将对齐百分比从 80%80\% 降至 6%6\%。我们进一步通过对最终模型应用安全对齐训练来测试攻击的鲁活性,证明即使在这种情况下,后门攻击仍在 60%60\% 的情况下成功。

关键词

引用

@article{arxiv.2604.02372,
  title  = {Backdoor Attacks on Decentralised Post-Training},
  author = {Oğuzhan Ersoy and Nikolay Blagoev and Jona te Lintelo and Stefanos Koffas and Marina Krček and Stjepan Picek},
  journal= {arXiv preprint arXiv:2604.02372},
  year   = {2026}
}

备注

Accepted to ICLR 2026 Workshop 'Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities'