中文

BERT真的鲁棒吗?一种用于文本分类与蕴含的自然语言攻击强基线

计算与语言 2020-04-10 v6 人工智能 机器学习

摘要

机器学习算法常常易受对抗样本的攻击,这些样本与原始对应样本仅有难以察觉的改动,却能欺骗最先进的模型。通过暴露精心制造的恶意对抗样本,有助于评估甚至提升这些模型的鲁棒性。本文提出TextFooler,一个简单但强大的用于生成自然对抗文本的基线方法。将其应用于文本分类与文本蕴含两项基础自然语言任务,我们成功攻击了三个目标模型,包括强大的预训练BERT,以及广泛使用的卷积与循环神经网络。我们从三方面展示该框架的优势:(1)有效——在成功率和扰动率上优于最先进的攻击;(2)保持效用——保留语义内容与语法正确性,且仍能被人类正确分类;(3)高效——以与文本长度成线性的计算复杂度生成对抗文本。*代码、预训练目标模型和测试样例可在 https://github.com/jind11/TextFooler 获取。

关键词

引用

@article{arxiv.1907.11932,
  title  = {Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment},
  author = {Di Jin and Zhijing Jin and Joey Tianyi Zhou and Peter Szolovits},
  journal= {arXiv preprint arXiv:1907.11932},
  year   = {2020}
}

备注

AAAI 2020 (Oral)