中文

重新思考后门攻击

密码学与安全 2023-07-20 v1 机器学习 机器学习

摘要

在后门攻击中, adversary(敌手)将恶意构造的后门样本插入训练集,使所得模型易被操纵。对此类攻击的防御通常将这些插入样本视为训练集中的离群点,并利用稳健统计中的技术检测并移除它们。本工作中,我们提出一种处理后门攻击问题的不同思路。具体而言,我们表明在不具备训练数据分布结构信息的情况下,后门攻击与数据中自然出现的特征无法区分——因而在一般意义上不可能被“检测”。进而,受此观察引导,我们重访现有后门攻击防御并刻画其所做且依赖的(常为潜在的)假设。最后,我们探索后门攻击的一种替代视角:假设这些攻击对应于训练数据中最强的特征。在此假设(我们将其形式化)下,我们开发了一种检测后门攻击的新原语。我们的原语自然催生出一种附带理论保证且实践中有效的检测算法。

关键词

引用

@article{arxiv.2307.10163,
  title  = {Rethinking Backdoor Attacks},
  author = {Alaa Khaddaj and Guillaume Leclerc and Aleksandar Makelov and Kristian Georgiev and Hadi Salman and Andrew Ilyas and Aleksander Madry},
  journal= {arXiv preprint arXiv:2307.10163},
  year   = {2023}
}

备注

ICML 2023