中文

单一毒样注入的非全知后门攻击:线性回归、线性分类与 2 层 ReLU 神经网络的单一毒假设证明

机器学习 2026-01-06 v2 密码学与安全

摘要

后门毒化攻击是针对在大规模数据集上训练的机器学习模型的威胁;这些攻击使攻击者能够注入可由特殊 crafted 输入触发的恶意行为。先前的工作已建立后门攻击成功性及其对良性学习任务影响的界限,但一个开放问题是成功实施后门攻击所需的毒化数据量。典型攻击要么使用少量样本但需要大量数据点信息,要么需要毒化大量数据点。本文提出单一毒假设:仅凭一个毒样和有限的背景知识,攻击者即可实现零错误后门注入,且不会显著影响良性学习任务性能。我们证明了该单一毒假设适用于线性回归、线性分类和 2 层 ReLU 神经网络。对于利用未被干净数据分布所覆盖的方向作为毒样的攻击者,我们证明了线性分类和线性回归导致的模型在功能上等价于训练时排除了毒样的模型。在所有其他情况下,基于统计后门学习的先前工作表明,对良性学习任务的影响仍有限。我们通过真实可靠的基准数据集实�验证了理论结果。

关键词

引用

@article{arxiv.2508.05600,
  title  = {Non-omniscient backdoor injection with one poison sample: Proving the one-poison hypothesis for linear regression, linear classification, and 2-layer ReLU neural networks},
  author = {Thorsten Peinemann and Paula Arnold and Sebastian Berndt and Thomas Eisenbarth and Esfandiar Mohammadi},
  journal= {arXiv preprint arXiv:2508.05600},
  year   = {2026}
}

备注

Added generalization to 2-layer ReLU neural networks