针对对抗性词语替换的认证鲁棒性
计算与语言
2019-09-04 v1 机器学习
摘要
最先进的 NLP 模型常能被施加看似无害且保持标签的变换(如释义)于输入文本的对手欺骗。可能变换的数量随文本长度指数级增长,因此数据增强无法覆盖输入的所有变换。本文考虑一个指数级大的保持标签的变换族,其中输入中每个词可被相似词替换。我们训练了首批对该族中所有词语替换可证明鲁棒的模型。我们的训练过程使用区间界传播(Interval Bound Propagation, IBP) 来最小化任何词语替换组合所能引起的最坏情况损失的上界。为评估模型对这些变换的鲁棒性,我们测量在应用于测试样本的对抗性选定词语替换上的准确率。我们的 IBP 训练模型在 IMDB 情感分析和 SNLI 自然语言推理上均达到 的对抗准确率。相比之下,在 IMDB 上,正常训练的模型和用数据增强训练的模型分别仅达到 和 的对抗准确率。
引用
@article{arxiv.1909.00986,
title = {Certified Robustness to Adversarial Word Substitutions},
author = {Robin Jia and Aditi Raghunathan and Kerem Göksel and Percy Liang},
journal= {arXiv preprint arXiv:1909.00986},
year = {2019}
}
备注
EMNLP 2019