过剩容量与后门投毒
机器学习
2021-11-05 v3 密码学与安全
机器学习
摘要
后门数据投毒攻击是一种对抗性攻击,攻击者在训练集中注入若干带水印、错误标注的训练样本。该水印不影响模型在典型数据上的测试期性能;然而,模型会对带水印样本稳定地出错。为更好地理解后门数据投毒攻击的基础原理,我们提出一个形式化理论框架,用以讨论分类问题中的后门数据投毒攻击。我们随后利用该框架分析围绕这些攻击的重要统计与计算问题。在统计方面,我们确定一个称为记忆容量的参数,其刻画了学习问题对后门攻击的内在脆弱性。这使我们能够论证若干自然学习问题对后门攻击的鲁棒性。我们利于攻击者的结果包括给出后门攻击的显式构造,而我们的鲁棒性结果表明某些自然问题设定无法产生成功的后门攻击。从计算角度看,我们表明在特定假设下,对抗训练可检测训练集中后门的存在。我们随后表明在类似假设下,两个密切相关的问题——我们称之为后门过滤与鲁棒泛化——近乎等价。这意味着,为获得一个既能良好泛化至未见数据又对后门鲁棒的学习算法,设计与训练集中识别带水印样本的算法既是渐近必要的也是充分的。
引用
@article{arxiv.2109.00685,
title = {Excess Capacity and Backdoor Poisoning},
author = {Naren Sarayu Manoj and Avrim Blum},
journal= {arXiv preprint arXiv:2109.00685},
year = {2021}
}
备注
Accepted to NeurIPS 2021