房间中的大象:一种评估 NLP 中对抗样本的评价框架
计算与语言
2020-06-02 v3 机器学习
摘要
对抗样本是经过微小扰动变换、机器学习模型持续误分类的输入。尽管已有多种针对文本数据生成对抗样本的方法被提出,评估这些对抗样本的质量并非易事,因为微小扰动(如更改句子中的一个词)可能导致其语义、可读性与分类标签的显著偏移。本文提出一个由一组自动评价指标与人工评估准则组成的评价框架,基于上述性质严格评估对抗样本的质量。我们以六种基准攻击方法实验,发现部分方法生成的对抗样本可读性与内容保持较差。我们还了解到多个因素可能影响攻击性能,如文本输入的长度与分类器的架构。
引用
@article{arxiv.2001.07820,
title = {Elephant in the Room: An Evaluation Framework for Assessing Adversarial Examples in NLP},
author = {Ying Xu and Xu Zhong and Antonio Jose Jimeno Yepes and Jey Han Lau},
journal= {arXiv preprint arXiv:2001.07820},
year = {2020}
}