中文

对抗训练对语言模型鲁棒性与泛化能力的影响

计算与语言 2023-12-12 v3 人工智能

摘要

对抗训练被广泛认为是抵御对抗攻击最有效的防御手段。然而,同样公认的是,在对抗训练模型中同时实现鲁棒性和泛化能力涉及权衡。这项工作的目标是对语言模型中不同的对抗训练方法进行深入比较。具体而言,我们研究了预训练数据增强以及训练时输入空间扰动与嵌入空间扰动对基于 Transformer 的语言模型鲁棒性和泛化能力的影响。我们的研究结果表明,通过预训练数据增强或输入空间扰动训练可以实现更好的鲁棒性。然而,使用嵌入空间扰动训练可显著提高泛化能力。对学习模型的神经元进行的语言学相关性分析表明,泛化能力的提高归因于“更专业化”的神经元。据我们所知,这是首项对语言模型对抗训练中不同对抗样本生成方法进行深入定性分析的工作。

关键词

引用

@article{arxiv.2211.05523,
  title  = {Impact of Adversarial Training on Robustness and Generalizability of Language Models},
  author = {Enes Altinisik and Hassan Sajjad and Husrev Taha Sencar and Safa Messaoud and Sanjay Chawla},
  journal= {arXiv preprint arXiv:2211.05523},
  year   = {2023}
}