中文

面向中文 BERT 分类器鲁棒性的评估

计算与语言 2020-04-09 v1 机器学习

摘要

诸如 BERT 等大规模语言表示模型的最新进展提升了诸多 NLP 任务的当前最优性能。同时,包括中文 BERT 在内的字符级中文 NLP 模型也已证明能够超越现有模型。本文中,我们表明此类基于 BERT 的模型在字符级对抗攻击下是脆弱的。我们提出一种针对基于 BERT 的分类器的新颖中文字级攻击方法。本质上,我们在嵌入空间中对字符级进行“微小”扰动并引导字符替换过程。大量实验表明,基于所提攻击,通过对平均少于 2 个字符的操控,中文新闻数据集上的分类准确率从 91.8% 降至 0%。人工评估也证实我们所生成的中文对抗样本几乎不影响人类在这些 NLP 任务上的表现。

关键词

引用

@article{arxiv.2004.03742,
  title  = {Towards Evaluating the Robustness of Chinese BERT Classifiers},
  author = {Boxin Wang and Boyuan Pan and Xin Li and Bo Li},
  journal= {arXiv preprint arXiv:2004.03742},
  year   = {2020}
}