中文

影師之杖:利用特征边界模糊性进行稳健后门攻击

机器学习 2025-12-18 v2 人工智能

摘要

深度神经网络(DNN)支撑着关键应用,却暴露于后门攻击,后者通常依赖于启发式的蛮力方法。尽管后门研究在实证方面取得了显著进展,但缺乏严格的理论分析限制了对底层机制的理解,限制了攻击的可预测性和可适应性。因此,我们对后门攻击进行理论分析,关注稀疏决策边界如何启用大量模型操纵。基于这一发现,我们推导出一种闭式、模糊的边界区域,其中微小的重新标记样本可导致显著的误分类。影响函数分析进一步量化了这些边缘样本造成的显著参数偏移,而对干净准确率的影响极小,形式上解释了为何如此低的中毒率足以实现有效的攻击。利用这些见解,我们提出Eminence,一个具有可证明理论保证和内在隐形性的可解释且稳健的黑盒后门框架。Eminence优化一个通用且视觉上微妙的触发器,战略性地利用易受攻击的决策边界,有效地以极低的中毒率(< 0.1%,而SOTA方法通常需要> 1%)实现稳健的误分类。综合实验验证了我们的理论讨论,证明了Eminence的有效性,确认了边缘中毒与对抗性边界操纵之间的指数关系。Eminence保持> 90%的攻击成功率,显示出极小的干净准确率损失,并在 diverse models、datasets and scenarios之间表现出高transferability。

关键词

引用

@article{arxiv.2512.10402,
  title  = {The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks},
  author = {Zhou Feng and Jiahao Chen and Chunyi Zhou and Yuwen Pu and Tianyu Du and Jinbao Li and Jianhai Chen and Shouling Ji},
  journal= {arXiv preprint arXiv:2512.10402},
  year   = {2025}
}

备注

Accepted by KDD2026 Cycle 1 Research Track