利用目标信息改进并提升文本对抗攻击的效率
机器学习
2021-05-04 v2 人工智能
计算与语言
密码学与安全
摘要
近年来,在黑盒设定下研究自然语言模型对抗样本的兴趣日益增长。这些方法通过扰动某些重要词直到分类器标签改变来攻击自然语言分类器。为了找到这些重要词,这些方法对每个输入句子逐词查询目标模型,对所有词按重要性排序,导致查询效率低下。一种新颖有趣的方法通过可解释学习来学习词排序,而非此前昂贵的搜索,从而解决了该问题。使用该方法的主要优势在于,其攻击成功率与最先进方法相当,但更快且查询更少,而更少的查询有助于避免攻击代理引起怀疑。然而,该方法为了查询效率牺牲了可从目标分类器中利用的有用信息。在本文中,我们研究了利用目标模型输出与数据对攻击成功率和平均查询数的影响,并表明二者均可得到改进,且仅带来有限的额外查询开销。
引用
@article{arxiv.2104.13484,
title = {Improved and Efficient Text Adversarial Attacks using Target Information},
author = {Mahmoud Hossam and Trung Le and He Zhao and Viet Huynh and Dinh Phung},
journal= {arXiv preprint arXiv:2104.13484},
year = {2021}
}
备注
Accepted in the International Conference on Learning Representations (ICLR) workshop on Robust and Reliable Machine Learning in the Real World (RobustML)