基于标签平滑的域内与域外文本对抗鲁棒性
计算与语言
2023-07-13 v2 密码学与安全
机器学习
摘要
近来研究表明,最先进的 NLP 模型易受对抗攻击,即模型的预测可被对输入的细微修改(如近义词替换)大幅改变。尽管已提出并适配了若干防御技术以应对文本对抗攻击的离散特性,但诸如标签平滑等面向语言模型的通用正则化方法的益处尚未被研究。在本文中,我们研究了在基础模型中各种标签平滑策略在域内与域外设置下对多样 NLP 任务的对抗鲁棒性所提供的保障。我们的实验表明,标签平滑显著提升了如 BERT 等预训练模型针对多种流行攻击的对抗鲁棒性。我们还分析了预测置信度与鲁棒性之间的关系,显示标签平滑减少了在对抗样本上的过度自信错误。
引用
@article{arxiv.2212.10258,
title = {In and Out-of-Domain Text Adversarial Robustness via Label Smoothing},
author = {Yahan Yang and Soham Dan and Dan Roth and Insup Lee},
journal= {arXiv preprint arXiv:2212.10258},
year = {2023}
}