后门平滑:揭示深度神经网络上的后门攻击
机器学习
2021-11-03 v4 密码学与安全
机器学习
摘要
后门攻击在测试时呈现特定触发器时会误导机器学习模型输出攻击者指定的类别。这些攻击需要毒化训练数据以破坏学习算法,例如,通过将包含触发器的投毒样本与期望的类别标签一起注入训练集。尽管关于后门攻击与防御的研究日益增多,但影响后门攻击成功的潜在因素及其对学习算法的影响尚未被充分理解。在这项工作中,我们旨在通过揭示后门攻击在触发样本周围诱导出更平滑的决策函数——我们称之为\textit{后门平滑}(backdoor smoothing)的现象,来阐明这一问题。为量化后门平滑,我们定义了一种度量,用于评估分类器在输入样本周围的预测不确定性。我们的实验表明,当触发器被添加到输入样本时平滑度增加,并且这种现象在更成功的攻击中更为明显。我们还提供了初步证据,表明后门触发器并非唯一诱导平滑的模式,我们的方法也能检测到其他人工模式,这为理解当前防御的局限性和设计新防御开辟了道路。
引用
@article{arxiv.2006.06721,
title = {Backdoor Smoothing: Demystifying Backdoor Attacks on Deep Neural Networks},
author = {Kathrin Grosse and Taesung Lee and Battista Biggio and Youngja Park and Michael Backes and Ian Molloy},
journal= {arXiv preprint arXiv:2006.06721},
year = {2021}
}
备注
9 pages, 7 figures, under submission