中文

无需对抗防御的对抗防御:通过实例级主成分移除提升语言模型鲁棒性

计算与语言 2025-10-17 v4

摘要

预训练语言模型(PLMs)在自然语言处理领域取得了显著进展,但仍然容易受到对抗攻击,这引发了对其在实际应用中鲁棒性的担忧。以往研究通过引入对抗扰动到训练过程中(显式或隐式)来缓解对抗攻击的影响。尽管两种策略都增强了鲁棒性,但往往造成高的计算成本。本文提出一种简单且有效的附加模块,通过移除实例级主成分来增强PLMs的对抗鲁棒性,而无需依赖常规对抗防御或扰动原始训练数据。该方法将嵌入空间转换为近似高斯属性,从而降低其对抗扰动的易受性,同时保持语义关系。这种转换在嵌入分布上进行对齐,最小化对抗噪声对决策边界的影响,从而在不要求对抗示例或高成本训练时增强鲁棒性。在八个基准数据集上的评估显示,本方法在保持基线相当于入侵前准确率的同时,提高了对抗鲁棒性,实现了鲁棒性与泛化性之间的平衡。

关键词

引用

@article{arxiv.2507.21750,
  title  = {Adversarial Defence without Adversarial Defence: Enhancing Language Model Robustness via Instance-level Principal Component Removal},
  author = {Yang Wang and Chenghao Xiao and Yizhi Li and Stuart E. Middleton and Noura Al Moubayed and Chenghua Lin},
  journal= {arXiv preprint arXiv:2507.21750},
  year   = {2025}
}

备注

This paper was accepted with an A-decision to Transactions of the Association for Computational Linguistics. This version is the pre-publication version prior to MIT Press production