TREATED:面向文本对抗攻击的通用防御
机器学习
2021-09-15 v1 密码学与安全
摘要
近期研究表明深度神经网络易受对抗样本攻击。大量工作研究对抗样本生成,而极少工作关注更关键的对抗防御。现有对抗检测方法通常对对抗样本与攻击方法作出假设(例如对抗样本的词频、攻击方法的扰动水平)。然而,这限制了检测方法的适用性。为此,我们提出 TREATED,一种无需作任何假设即可防御不同扰动水平攻击的通用对抗检测方法。TREATED 通过一组精心设计的参考模型识别对抗样本。在三个竞争性神经网络与两个广泛使用数据集上的大量实验表明,我们的方法取得了优于基线的检测性能。我们最后进行消融实验以验证方法的有效性。
引用
@article{arxiv.2109.06176,
title = {TREATED:Towards Universal Defense against Textual Adversarial Attacks},
author = {Bin Zhu and Zhaoquan Gu and Le Wang and Zhihong Tian},
journal= {arXiv preprint arXiv:2109.06176},
year = {2021}
}