重新思考后门攻击
密码学与安全
2023-07-20 v1 机器学习
机器学习
摘要
在后门攻击中, adversary(敌手)将恶意构造的后门样本插入训练集,使所得模型易被操纵。对此类攻击的防御通常将这些插入样本视为训练集中的离群点,并利用稳健统计中的技术检测并移除它们。本工作中,我们提出一种处理后门攻击问题的不同思路。具体而言,我们表明在不具备训练数据分布结构信息的情况下,后门攻击与数据中自然出现的特征无法区分——因而在一般意义上不可能被“检测”。进而,受此观察引导,我们重访现有后门攻击防御并刻画其所做且依赖的(常为潜在的)假设。最后,我们探索后门攻击的一种替代视角:假设这些攻击对应于训练数据中最强的特征。在此假设(我们将其形式化)下,我们开发了一种检测后门攻击的新原语。我们的原语自然催生出一种附带理论保证且实践中有效的检测算法。
引用
@article{arxiv.2307.10163,
title = {Rethinking Backdoor Attacks},
author = {Alaa Khaddaj and Guillaume Leclerc and Aleksandar Makelov and Kristian Georgiev and Hadi Salman and Andrew Ilyas and Aleksander Madry},
journal= {arXiv preprint arXiv:2307.10163},
year = {2023}
}
备注
ICML 2023