ADDMU:基于数据与模型不确定性估计的远边界对抗样本检测
计算与语言
2022-10-25 v1 机器学习
摘要
对抗样本检测(AED)是一种针对对抗攻击的重要防御技术,已引起自然语言处理(NLP)社区越来越多的关注。尽管新的AED方法不断涌现,我们的研究表明现有方法严重依赖捷径以获得良好性能。换言之,当前NLP中基于搜索的对抗攻击一旦模型预测改变便停止,因此这些攻击生成的大多数对抗样本位于模型决策边界附近。为超越此捷径并公平评估AED方法,我们提出使用远边界(FB)对抗样本测试AED方法。在此场景下,现有方法表现劣于随机猜测。为克服该局限,我们提出一种新技术ADDMU(基于数据与模型不确定性的对抗检测),其结合两类不确定性估计以用于常规与FB对抗样本检测。我们的新方法在两种场景下分别以前景AUC指标超越先前方法3.6与6.0点。最后,我们的分析表明,ADDMU提供的两类不确定性可用于刻画对抗样本,并识别在对抗训练中对模型鲁棒性贡献最大的样本。
引用
@article{arxiv.2210.12396,
title = {ADDMU: Detection of Far-Boundary Adversarial Examples with Data and Model Uncertainty Estimation},
author = {Fan Yin and Yao Li and Cho-Jui Hsieh and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2210.12396},
year = {2022}
}
备注
18 pages, EMNLP 2022, main conference, long paper