基于显著性注意与语义相似度的对抗扰动
摘要
本文介绍了一种增强的文本对抗攻击方法,称为基于显著性注意与语义相似度的对抗扰动(SASSP)。该方案旨在通过整合显著性、注意力和语义相似度来提高上下文扰动的有效性。传统的对抗攻击方法在有效欺骗目标模型的同时,往往难以保持语义一致性和连贯性。我们提出的方法通过采用三管齐下的词选择和扰动策略来解决这些挑战。首先,我们利用基于显著性的词选择,根据词对模型预测的重要性来优先选择要修改的词。其次,采用注意力机制将扰动集中在上下文重要的词上,从而提高攻击的有效性。最后,采用一种先进的语义相似度检查方法,包括基于嵌入的相似度和释义检测。通过利用Sentence-BERT等模型进行嵌入相似度计算,以及来自Sentence Transformers库的微调释义检测模型,该方案确保扰动后的文本在上下文上保持适当,并与原始文本语义一致。实证评估表明,SASSP生成的对抗样本不仅保持了高语义保真度,而且有效地欺骗了最先进的自然语言处理模型。此外,与原始的上下文扰动方案CLARE相比,SASSP取得了更高的攻击成功率和更低的词扰动率。
引用
@article{arxiv.2406.19413,
title = {Saliency Attention and Semantic Similarity-Driven Adversarial Perturbation},
author = {Hetvi Waghela and Jaydip Sen and Sneha Rakshit},
journal= {arXiv preprint arXiv:2406.19413},
year = {2025}
}
备注
The paper is 12 pages long. and it contains 5 tables. It is the pre-reviewed version of the paper that has been accepted for oral presentation and publication in the 5th International Conference on Data Science and Applications which will be organized in Jaipur, India from July 17 to 19, 2024. This is not the final version