AED:一种黑盒 NLP 分类器模型攻击方法
机器学习
2024-11-05 v4 密码学与安全
摘要
深度神经网络(DNNs)已成功解决互联与自动驾驶车辆、疾病和招聘等领域的现实任务。然而,它们在关键应用领域的影响深远。因此,人们日益关注这些 DNN 模型的潜在偏见与鲁棒性。在医疗和金融等强制要求可靠与安全的低风险领域,始终需要透明且鲁棒的模型。尽管多数研究聚焦于对抗图像攻击场景,但由于自然语言处理(NLP)的对抗样本难以生成,较少研究考察 DNN 模型在 NLP 中的鲁棒性。为弥补这一空白,我们提出一种词级 NLP 分类器攻击模型“AED”,其全称是基于注意力机制的后模型解释与密度峰值聚类同义词搜索替换(Attention mechanism enabled post-model Explanation with Density peaks clustering algorithm for synonyms search and substitution)。AED 旨在通过可解释性揭示弱点并探索优化替代方案来测试 NLP DNN 模型的鲁棒性。通过识别漏洞并提供解释,AED 有助于提升医疗与自动驾驶等关键应用领域中 DNN 模型的可靠性和安全性。我们的实验结果表明,与其他现有模型相比,AED 能有效生成对抗样本,在保持输入原意的同时欺骗受害模型。
引用
@article{arxiv.2112.11660,
title = {AED: An black-box NLP classifier model attacker},
author = {Yueyang Liu and Yan Huang and Zhipeng Cai},
journal= {arXiv preprint arXiv:2112.11660},
year = {2024}
}