中文

迁移学习场景下语言模型对抗鲁棒性研究

计算与语言 2025-06-10 v2 人工智能 密码学与安全 机器学习

摘要

我们探讨了在迁移学习场景中大语言模型(LLM)的对抗鲁棒性。通过在多个数据集(MBIB 仇恨言论、MBIB 政治偏见、MBIB 性别偏见)和各种模型架构(BERT、RoBERTa、GPT-2、Gemma、Phi)上进行全面实验,我们发现迁移学习虽然提高了标准性能指标,却常常导致对对抗攻击的脆弱性增加。我们的发现表明,较大的模型对这一现象具有更大的抵抗力,这表明模型大小、架构和适应方法之间存在复杂的相互作用。我们的工作凸显了在迁移学习场景中考虑对抗鲁棒性的重要性,并提供了在不损害性能的前提下维持模型安全性的见解。这些发现对 LLM 在实际应用中部署具有重大意义,两者都要求性能和鲁棒性。

关键词

引用

@article{arxiv.2501.00066,
  title  = {On Adversarial Robustness of Language Models in Transfer Learning},
  author = {Bohdan Turbal and Anastasiia Mazur and Jiaxu Zhao and Mykola Pechenizkiy},
  journal= {arXiv preprint arXiv:2501.00066},
  year   = {2025}
}