中文

ProP: 通过传播扰动实现过参数化模型的高效后门检测

密码学与安全 2024-11-12 v1

摘要

后门攻击对机器学习模型的安全性构成重大挑战,尤其是对深度神经网络等过参数化模型而言。在本文中,我们提出 ProP(Propagation Perturbation),一种新颖且可扩展的后门检测方法,利用统计输出分布来识别后门模型及其目标类别,而无需依赖穷举优化策略。ProP 引入了一种新指标——良性分数(benign score),用于量化输出分布并有效区分良性模型与后门模型。与现有方法不同,ProP 的假设极少,不需要先验知识关于触发器或恶意样本,使其高度适用于现实场景。在多种流行后门攻击上的广泛实验验证表明,ProP 实现了高检测准确率和计算效率,优于现有方法。这些结果凸显了 ProP 作为一种稳健且实用的后门检测解决方案的潜力。

关键词

引用

@article{arxiv.2411.07036,
  title  = {ProP: Efficient Backdoor Detection via Propagation Perturbation for Overparametrized Models},
  author = {Tao Ren and Qiongxiu Li},
  journal= {arXiv preprint arXiv:2411.07036},
  year   = {2024}
}