中文

社区训练中后门吸收的力量

密码学与安全 2026-07-07 v1 机器学习

摘要

后门攻击严重威胁大规模AI模型。当模型所有者在去中心化训练范式中将训练委托给外部计算提供商时,对手可以精心设计隐蔽的、低频的触发器来注入恶意行为,同时规避标准审计。传统上,检测这些攻击需要对训练步骤进行完全重新计算——这是一种高昂的开销,与所有者的资源限制直接矛盾。为了解决这个问题,我们研究了在拜占庭扰动下连续优化动态的鲁棒性,其中对手被迫与持续涌入的诚实更新竞争。在对手破坏n个训练者中f个的威胁模型下,我们量化了模型所有者概率性地限制攻击成功率所需的最小审计开销。我们将这种注入-吸收动态形式化为离散时间马尔可夫链(DTMC)。利用这个框架,我们证明了在结合自然吸收、随机调度器和惰性验证预言机的防御策略下,任何有界对手的成功概率渐近地趋于零。实证结果表明,即使在仅对总训练步骤的10%调用验证预言机时,也能实现显著的后门抑制且零效用退化。这种方法为安全关键的AI提供了一种可证明正确且计算高效的防御。

关键词

引用

@article{arxiv.2607.06643,
  title  = {The Power of Backdoor Absorption in Community Training},
  author = {Issam Seddik and Sami Souihi and Mohamed Tamaazousti and Sara Tucci Piergiovanni},
  journal= {arXiv preprint arXiv:2607.06643},
  year   = {2026}
}

备注

Technical Report, CEA-LIST. 15 pages, 5 figures, 2 tables