防御隐蔽后门攻击
密码学与安全
2022-05-31 v1 计算与语言
摘要
针对安全威胁的防御一直是近期研究的关注点。最近的工作表明,攻击自然语言处理(NLP)模型并非难事,而防御它们仍是一场猫鼠游戏。后门攻击即此类攻击之一:使神经网络在含特定触发器的样本上以某种方式表现,而在其他样本上取得正常结果。本工作中,我们提出若干可用于抵御此类攻击的防御策略。我们表明,我们的防御方法显著降低了在受攻击输入上的性能,同时在良性输入上保持相似性能。我们还表明,部分防御具有极短运行时间,且与原始输入保持相似性。
引用
@article{arxiv.2205.14246,
title = {Defending Against Stealthy Backdoor Attacks},
author = {Sangeet Sagar and Abhinav Bhatt and Abhijith Srinivas Bidaralli},
journal= {arXiv preprint arXiv:2205.14246},
year = {2022}
}