保留标签的短语级文本对抗攻击
计算与语言
2022-05-25 v2 人工智能
摘要
生成高质量文本对抗样本对于探究自然语言处理(NLP)模型的缺陷并进而提升其鲁棒性至关重要。现有攻击通常通过词级或句级扰动实现,前者限制了扰动空间,后者牺牲了流畅度与文本质量,均影响攻击效果。本文提出短语级文本对抗攻击(PLAT),通过短语级扰动生成对抗样本。PLAT 首先借助句法分析器提取脆弱短语作为攻击目标,随后利用预训练的填空模型对其扰动。此种灵活的扰动设计大幅扩展了搜索空间以实现更有效的攻击,且不引入过多修改,同时借助上下文生成利用周边文本保持文本流畅性与语法性。此外,我们开发了标签保留过滤器,利用在每个类别上微调的语言模型似然而非文本相似度,来排除那些可能改变人类所指原始类标签的扰动。大量实验与人工评估表明,PLAT 相较强基线具有更优的攻击有效性与更好的标签一致性。
引用
@article{arxiv.2205.10710,
title = {Phrase-level Textual Adversarial Attack with Label Preservation},
author = {Yibin Lei and Yu Cao and Dianqi Li and Tianyi Zhou and Meng Fang and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2205.10710},
year = {2022}
}
备注
NAACL-HLT 2022 Findings (Long), 9 pages + 2 pages references + 8 pages appendix