中文

伪装即所需:评估与增强语言模型对抗伪装对抗性攻击的鲁棒性

计算与语言 2024-02-16 v1

摘要

对抗性攻击代表了自然语言处理 (NLP) 中的一个重大挑战。本研究分两个不同阶段系统地探讨了这一挑战:Transformer 模型在对抗性攻击下的脆弱性评估与韧性增强。在评估阶段,我们评估了三种 Transformer 配置(编码器 - 解码器、仅编码器和仅解码器)在包含攻击性语言和虚假信息的数据集上,面对日益复杂的对抗性攻击的易感性。仅编码器模型在攻击性语言检测和虚假信息检测任务中的性能分别下降了 14% 和 21%。仅解码器模型在这两个任务中均记录了 16% 的下降,而编码器 - 解码器模型在相应任务中的最大性能下降分别为 14% 和 26%。韧性增强阶段采用对抗性训练,整合了预伪装和动态改变的数据。这种方法有效地将仅编码器模型在攻击性语言检测和虚假信息检测任务中的性能下降分别平均降低至 5% 和 2%。仅解码器模型有时甚至超过原始性能,将相应任务中的性能下降限制在 7% 和 2%。虽然未能超越原始性能,但编码器 - 解码器模型可将下降幅度分别平均减少至 6% 和 2%。结果表明性能与鲁棒性之间存在权衡,某些模型在保持相似性能的同时获得了鲁棒性。我们的研究和对抗性训练技术已被整合到一个用于生成伪装数据集的开源工具中。然而,方法的有效性取决于具体的伪装技术和所遇到的数据,强调需要持续探索。

关键词

引用

@article{arxiv.2402.09874,
  title  = {Camouflage is all you need: Evaluating and Enhancing Language Model Robustness Against Camouflage Adversarial Attacks},
  author = {Álvaro Huertas-García and Alejandro Martín and Javier Huertas-Tato and David Camacho},
  journal= {arXiv preprint arXiv:2402.09874},
  year   = {2024}
}

备注

19 pages, 8 figures, 5 tables