中文

一种基于改进词显著性的文本分类模型对抗攻击

计算与语言 2025-05-13 v1 密码学与安全 机器学习

摘要

本文提出了一种针对文本分类模型的新型对抗攻击方法,称为基于改进词显著性的对抗攻击(MWSAA)。该技术建立在词显著性概念的基础之上,对输入文本进行策略性扰动,旨在误导分类模型的同时保持语义连贯性。通过对传统对抗攻击方法的改进,MWSAA显著提升了其规避分类系统检测的效能。该方法首先通过显著性估计过程识别输入文本中的显著词,优先选择对模型决策过程影响最大的词。随后,在语义相似度度量的指导下对这些显著词进行精心修改,以确保修改后的文本保持连贯并保留其原始含义。在多个文本分类数据集上进行的实证评估表明,所提方法在生成能够成功欺骗最先进分类模型的对抗样本方面是有效的。与现有对抗攻击技术的对比分析进一步表明,所提方法在攻击成功率和文本连贯性保持方面均具有优越性。

关键词

引用

@article{arxiv.2403.11297,
  title  = {A Modified Word Saliency-Based Adversarial Attack on Text Classification Models},
  author = {Hetvi Waghela and Sneha Rakshit and Jaydip Sen},
  journal= {arXiv preprint arXiv:2403.11297},
  year   = {2025}
}

备注

The paper is a preprint of a version submitted in ICCIDA 2024. It consists of 10 pages and contains 7 tables