中文

房间中的大象:一种评估 NLP 中对抗样本的评价框架

计算与语言 2020-06-02 v3 机器学习

摘要

对抗样本是经过微小扰动变换、机器学习模型持续误分类的输入。尽管已有多种针对文本数据生成对抗样本的方法被提出,评估这些对抗样本的质量并非易事,因为微小扰动(如更改句子中的一个词)可能导致其语义、可读性与分类标签的显著偏移。本文提出一个由一组自动评价指标与人工评估准则组成的评价框架,基于上述性质严格评估对抗样本的质量。我们以六种基准攻击方法实验,发现部分方法生成的对抗样本可读性与内容保持较差。我们还了解到多个因素可能影响攻击性能,如文本输入的长度与分类器的架构。

关键词

引用

@article{arxiv.2001.07820,
  title  = {Elephant in the Room: An Evaluation Framework for Assessing Adversarial Examples in NLP},
  author = {Ying Xu and Xu Zhong and Antonio Jose Jimeno Yepes and Jey Han Lau},
  journal= {arXiv preprint arXiv:2001.07820},
  year   = {2020}
}