无需重训练,只需重写:通过对文本重写抵御对抗扰动
计算与语言
2023-05-29 v1
摘要
语言模型能否转换输入以保护文本分类器免受对抗攻击?在本文中,我们提出 ATINTER,一种拦截并学习重写对抗输入以使其对下游文本分类器非对抗化的模型。我们在四个数据集和五种攻击机制上的实验表明,ATINTER 在提供比现有防御方法更好的对抗鲁棒性的同时,不损害任务准确率。例如,在使用 SST-2 数据集的情感分类上,我们的方法比最佳现有防御方法的对抗准确率提高了 4% 以上,且任务准确率下降更小(0.5% 对比 2.5%)。此外,我们表明 ATINTER 可泛化到多个下游任务与分类器,而无需针对这些设置显式重训练。具体而言,我们发现当 ATINTER 被训练用于去除 SST-2 数据集上情感分类任务的对抗扰动时,它甚至能迁移到语义不同的新闻分类任务(在 AGNews 上),并将对抗鲁棒性提高 10% 以上。
引用
@article{arxiv.2305.16444,
title = {Don't Retrain, Just Rewrite: Countering Adversarial Perturbations by Rewriting Text},
author = {Ashim Gupta and Carter Wood Blum and Temma Choji and Yingjie Fei and Shalin Shah and Alakananda Vempala and Vivek Srikumar},
journal= {arXiv preprint arXiv:2305.16444},
year = {2023}
}
备注
Accepted to ACL 2023