攻击可解释自然语言处理系统
密码学与安全
2025-07-23 v1 人工智能
机器学习
摘要
研究表明,机器学习系统在理论和实践中均易受对抗样本攻击。以往的攻击主要针对利用人类与机器感知差异的视觉模型,而基于文本的模型同样受到此类攻击的影响。然而,这些攻击往往无法保持文本的语义和相似性。本文提出了 AdvChar,一种针对可解释自然语言处理系统的黑盒攻击方法,旨在误导分类器的同时使解释结果与良性输入相似,从而利用对系统透明度的信任。AdvChar 通过对文本输入进行不易察觉的修改来实现这一点,迫使深度学习分类器做出错误预测并保留原始解释。我们使用以解释为中心的评分方法来确定最关键的 token,这些 token 被修改后可导致分类器对输入进行误分类。我们应用简单的字符级修改来衡量 token 的重要性,在最小化原始文本与新文本之间差异的同时,生成与良性输入相似的对抗性解释。我们通过在分类任务的基准数据集上对七种 NLP 模型和三种解释模型进行测试,全面评估了 AdvChar。实验表明,AdvChar 仅在输入样本中平均修改两个字符,即可显著降低当前深度学习模型的预测准确率。
引用
@article{arxiv.2507.16164,
title = {Attacking interpretable NLP systems},
author = {Eldor Abdukhamidov and Tamer Abuhmed and Joanna C. S. Santos and Mohammed Abuhamad},
journal= {arXiv preprint arXiv:2507.16164},
year = {2025}
}