一种基于影响图的通用后门攻击防御框架
机器学习
2021-11-30 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
本工作中,我们提出一个新的通用框架以防御后门攻击,其启发在于攻击触发器通常遵循一种特定类型的攻击模式,因此,被投毒的训练样本在训练期间彼此具有更大的影响。我们引入影响图的概念,其由节点与边组成,分别表征单个训练点与相关的成对影响。一对训练点之间的影响表示移除一个训练点对另一个预测的影响,由影响函数近似\citep{koh2017understanding}。恶意训练点通过寻找受特定大小约束的最大平均子图来提取。在计算机视觉与自然语言处理任务上的大量实验证明了所提框架的有效性与通用性。
引用
@article{arxiv.2111.14309,
title = {A General Framework for Defending Against Backdoor Attacks via Influence Graph},
author = {Xiaofei Sun and Jiwei Li and Xiaoya Li and Ziyao Wang and Tianwei Zhang and Han Qiu and Fei Wu and Chun Fan},
journal= {arXiv preprint arXiv:2111.14309},
year = {2021}
}