BERT真的鲁棒吗?一种用于文本分类与蕴含的自然语言攻击强基线
计算与语言
2020-04-10 v6 人工智能
机器学习
摘要
机器学习算法常常易受对抗样本的攻击,这些样本与原始对应样本仅有难以察觉的改动,却能欺骗最先进的模型。通过暴露精心制造的恶意对抗样本,有助于评估甚至提升这些模型的鲁棒性。本文提出TextFooler,一个简单但强大的用于生成自然对抗文本的基线方法。将其应用于文本分类与文本蕴含两项基础自然语言任务,我们成功攻击了三个目标模型,包括强大的预训练BERT,以及广泛使用的卷积与循环神经网络。我们从三方面展示该框架的优势:(1)有效——在成功率和扰动率上优于最先进的攻击;(2)保持效用——保留语义内容与语法正确性,且仍能被人类正确分类;(3)高效——以与文本长度成线性的计算复杂度生成对抗文本。*代码、预训练目标模型和测试样例可在 https://github.com/jind11/TextFooler 获取。
引用
@article{arxiv.1907.11932,
title = {Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment},
author = {Di Jin and Zhijing Jin and Joey Tianyi Zhou and Peter Szolovits},
journal= {arXiv preprint arXiv:1907.11932},
year = {2020}
}
备注
AAAI 2020 (Oral)