中文

平衡对抗训练:在自然语言处理模型中权衡易变性与固执性

计算与语言 2022-11-01 v3

摘要

传统的(易变型)对抗样本涉及寻找一个不改变输入真实标签但使分类器混淆而输出不同预测的小扰动。相反,固执型对抗样本发生在 adversary 找到一个保留分类器预测但改变输入真实标签的小扰动时。对抗训练与认证鲁棒训练在提升机器学习模型对易变型对抗样本的鲁棒性方面已显示出一定有效性。我们表明,专注于降低对易变型对抗样本脆弱性的标准对抗训练方法,可能使模型对固执型对抗样本更加脆弱,并在自然语言推理与复述识别任务上进行了实验。为应对此现象,我们引入平衡对抗训练(Balanced Adversarial Training),其结合对比学习以提升对易变型与固执型对抗样本的鲁棒性。

关键词

引用

@article{arxiv.2210.11498,
  title  = {Balanced Adversarial Training: Balancing Tradeoffs between Fickleness and Obstinacy in NLP Models},
  author = {Hannah Chen and Yangfeng Ji and David Evans},
  journal= {arXiv preprint arXiv:2210.11498},
  year   = {2022}
}

备注

EMNLP 2022