中文

重构即所需:应对 DNN 中的恶意文本特征

机器学习 2025-09-26 v2 计算与语言 密码学与安全

摘要

人类语言包含广泛而复杂多样的隐含特征,攻击者可以利用这些特征发起对抗攻击或后门攻击,从而破坏用于 NLP 任务的 DNN 模型。现有的面向模型的防御通常随着模型规模的增大而需要大量的计算资源,而面向样本的防御通常只关注特定的攻击向量或方案,使其易受自适应攻击的影响。我们观察到,对抗攻击和后门攻击的根本原因都在于 DNN 模型的编码过程,在此过程中,对人类理解而言微不足道的细微文本特征,被不够鲁棒或被植入木马的模型错误地赋予了显著的权重。基于此,我们提出了一种统一且自适应的防御框架,该框架对对抗攻击和后门攻击均有效。我们的方法利用重构模块来处理文本输入中潜在的恶意特征,同时保留原始的语义完整性。大量实验表明,我们的框架在应对各种恶意文本特征方面,优于现有的面向样本的防御基线。

关键词

引用

@article{arxiv.2502.00652,
  title  = {Reformulation is All You Need: Addressing Malicious Text Features in DNNs},
  author = {Yi Jiang and Oubo Ma and Yong Yang and Tong Zhang and Shouling Ji},
  journal= {arXiv preprint arXiv:2502.00652},
  year   = {2025}
}

备注

Accepted by journal "Machine Intelligence Research"