中文

预测偏移不确定性解锁后门检测

组合数学 2024-06-11 v1

摘要

深度神经网络易受到后门攻击,即攻击者通过向训练数据中插入恶意样本来操控模型预测。在识别揭露潜在后门样本的训练数据的任务上仍存在显著挑战。本文提出了一种新方法:预测偏移后门检测 (PSBD),采用基于不确定性的方法,仅需少量无标签干净验证数据。PSBD 灵感来源于一种有趣的预测偏移 (PS) 现象:带后门模型在推理时对干净数据上的预测常常因 dropout 的应用而偏离真实标签,趋向于某些其他标签,而后门样本则表现出较小的 PS。我们假设 PS 源于神经元偏置效应,使神经元倾向于某些类别的特征。PSBD 通过计算在模型推理时启用和禁用 dropout 层时的概率值方差(即预测偏移不确定性, PSU)来识别后门训练样本。我们进行了大量实验以验证 PSBD 的有效性和效率,该方法在主流检测方法中实现了最先进的效果。代码已公开于 https://github.com/WL-619/PSBD。

关键词

引用

@article{arxiv.2406.05825,
  title  = {Broadcast independence and packing in certain classes of trees},
  author = {Richard C. Brewster and Kiara A. McDonald},
  journal= {arXiv preprint arXiv:2406.05825},
  year   = {2024}
}

备注

23 pages, 3 figures