TextDecepter:针对文本分类器的硬标签黑盒攻击
计算与语言
2020-12-29 v6 密码学与安全
机器学习
摘要
机器学习已被证明容易受到精心构造的样本(即对抗样本)的影响。这些对抗样本的生成有助于使模型更加鲁棒,并使我们深入了解这些模型的底层决策机制。多年来,研究者已在白盒和黑盒设定下成功攻击了图像分类器。然而,这些方法不能直接应用于文本,因为文本数据是离散的。近年来,针对文本应用构造对抗样本的研究不断增多。在本文中,我们提出了一种针对自然语言处理 (NLP) 分类器的硬标签黑盒攻击的新方法,其中不披露任何模型信息,攻击者只能查询模型以获得分类器的最终决策,而无法获得所涉及类别的置信度分数。此类攻击场景适用于现实世界中用于情感分析和有毒内容检测等安全敏感应用的黑盒模型。
引用
@article{arxiv.2008.06860,
title = {TextDecepter: Hard Label Black Box Attack on Text Classifiers},
author = {Sachin Saxena},
journal= {arXiv preprint arXiv:2008.06860},
year = {2020}
}
备注
10 pages, 11 tables