中文

DSRM:以分布偏移风险最小化提升文本对抗训练

计算与语言 2023-06-28 v1 机器学习

摘要

对抗训练是提升深度语言模型鲁棒性最优的方法之一。然而,鲁棒模型以高时间消耗为代价,因为它们需要多步梯度上升或词语替换来获取对抗样本。此外,这些生成的样本在语法质量与语义一致性上存在缺陷,削弱了对抗训练的效果。为解决这些问题,我们引入一种新颖、高效的流程,仅使用干净数据进行对抗训练。我们的流程,即分布偏移风险最小化(DSRM),通过扰动输入数据的概率分布而非其嵌入来估计对抗损失。该形式化得到一个在对抗攻击下最小化期望全局损失的鲁棒模型。我们的方法训练时无需任何对抗样本,与当前最优对抗训练方法相比最多减少 70% 的时间消耗。实验表明,DSRM 显著提升了 BERT 对文本对抗攻击的抵抗能力,并在多个基准上取得了最优鲁棒准确率。

关键词

引用

@article{arxiv.2306.15164,
  title  = {DSRM: Boost Textual Adversarial Training with Distribution Shift Risk Minimization},
  author = {Songyang Gao and Shihan Dou and Yan Liu and Xiao Wang and Qi Zhang and Zhongyu Wei and Jin Ma and Ying Shan},
  journal= {arXiv preprint arXiv:2306.15164},
  year   = {2023}
}

备注

Accepted by ACL2023