中文

对抗微调如何有益于 BERT?

计算与语言 2021-09-30 v2 人工智能 机器学习

摘要

对抗训练(AT)是机器学习中抵御对抗攻击最可靠的方法之一。该方法的变体已被用作正则化机制以在 NLP 基准上取得 SOTA 结果,并且已发现其有助于迁移学习与持续学习。我们通过对比原始与对抗微调的 BERT 模型来探寻 AT 生效的原因。我们确定微调过程中 BERT 句法能力的部分保留是 AT 成功的关键。我们观察到对抗微调模型更忠实于 BERT 的语言建模行为,且对词序更为敏感。作为句法能力的具体例证,对抗微调模型在指代一致上可具有高达 38% 的优势,在依存句法分析上可高达 11%。我们的分析表明,原始微调通过严重聚焦于一小部分词而过度简化句子表示。然而,AT 缓和了这些有影响力词的作用并鼓励表示的多样性。这使得句子获得更具层次性的表示,并缓解了 BERT 句法能力的丧失。

关键词

引用

@article{arxiv.2108.13602,
  title  = {How Does Adversarial Fine-Tuning Benefit BERT?},
  author = {Javid Ebrahimi and Hao Yang and Wei Zhang},
  journal= {arXiv preprint arXiv:2108.13602},
  year   = {2021}
}