中文

基于动态上下文扰动的对抗性文本生成

密码学与安全 2025-06-12 v1 计算与语言

摘要

对自然语言处理(NLP)模型的对抗攻击通过引入输入文本的微妙扰动来暴露漏洞,通常导致误分类同时保持人类可读性。现有方法通常聚焦于词级或局部文本片段的修改,忽略了更广泛的上下文,从而导致可检测的或语义不一致的扰动。我们提出了一种新的对抗性文本攻击方案,称为动态上下文扰动(DCP)。DCP在句子、段落和文档层面动态生成上下文感知的扰动,确保语义保真度和流畅性。利用预训练语言模型的能力,DCP通过一个对抗目标函数迭代优化扰动,该函数在诱导模型误分类和保持文本自然性之间取得平衡。这种全面的方法使DCP能够生成更复杂、更有效的对抗样本,更好地模拟自然语言模式。我们在各种NLP模型和数据集上进行的实验结果证明了DCP在挑战最先进的NLP系统鲁棒性方面的有效性。通过整合动态上下文分析,DCP显著增强了对抗攻击的微妙性和影响。本研究强调了上下文在对抗攻击中的关键作用,并为创建能够抵御复杂对抗策略的更鲁棒NLP系统奠定了基础。

关键词

引用

@article{arxiv.2506.09148,
  title  = {Adversarial Text Generation with Dynamic Contextual Perturbation},
  author = {Hetvi Waghela and Jaydip Sen and Sneha Rakshit and Subhasis Dasgupta},
  journal= {arXiv preprint arXiv:2506.09148},
  year   = {2025}
}

备注

This is the accepted version of the paper, which was presented at IEEE CALCON. The conference was organized at Jadavpur University, Kolkata, from December 14 to 15, 2025. The paper is six pages long, and it consists of six tables and six figures. This is not the final camera-ready version of the paper