R&R:基于指标引导的对抗性句子生成
计算与语言
2022-10-21 v3
摘要
对抗样本有助于分析和提升文本分类器的鲁棒性。生成高质量对抗样本是一项具有挑战性的任务,因为它要求生成流畅的对抗句子,这些句子与原始句子语义相似且保留原始标签,同时导致分类器对其误分类。现有方法通过最大化每次扰动误导文本分类器的有效性来优先考虑误分类;因此,所生成的对抗样本在流畅性和相似性方面存在不足。本文中,我们提出一种用于对抗攻击的重写与回滚(R&R)框架。它通过优化一个结合流畅性、相似性和误分类指标的评判分数来提升对抗样本的质量。R&R 允许探索那些对误分类指标无即时影响但能改善流畅性和相似性指标的扰动,从而生成高质量对抗样本。我们在 5 个代表性数据集和 3 种分类器架构上评估了我们的方法。我们的方法在攻击成功率上分别超越当前最先进水平 +16.2%、+12.8% 和 +14.0%。代码见 https://github.com/DAI-Lab/fibber
引用
@article{arxiv.2104.08453,
title = {R&R: Metric-guided Adversarial Sentence Generation},
author = {Lei Xu and Alfredo Cuesta-Infante and Laure Berti-Equille and Kalyan Veeramachaneni},
journal= {arXiv preprint arXiv:2104.08453},
year = {2022}
}
备注
Accepted to Finding of AACL-IJCNLP2022