针对具有鲁棒性感知扰动防御的NLP模型的后门攻击
密码学与安全
2022-04-13 v1 机器学习
摘要
后门攻击旨在将隐藏后门嵌入深度神经网络(DNNs)中,使得被攻击模型在良性样本上表现良好,而当隐藏后门被攻击者定义的触发器激活时,其预测会被恶意改变。当训练过程未被完全控制时,例如使用第三方数据集或采用第三方模型,这种威胁可能发生。已有大量研究及不同方法来防御此类后门攻击,其中一种为鲁棒性感知的基于扰动的防御方法。该方法主要利用中毒样本与干净样本之间鲁棒性的巨大差距。在我们的工作中,我们通过使用对抗训练步骤控制中毒样本与干净样本之间的鲁棒性差距,从而攻破了该防御。
引用
@article{arxiv.2204.05758,
title = {Backdoor Attack against NLP models with Robustness-Aware Perturbation defense},
author = {Shaik Mohammed Maqsood and Viveros Manuela Ceron and Addluri GowthamKrishna},
journal= {arXiv preprint arXiv:2204.05758},
year = {2022}
}