利用条件对抗正则化自编码器对文本数据集进行投毒攻击
计算与语言
2020-10-07 v1 人工智能
神经与进化计算
摘要
本文展示了自然语言推理(NLI)和文本分类系统中一个致命的漏洞。更具体地,我们提出了一种针对NLP模型的“后门投毒”攻击。我们的投毒攻击利用条件对抗正则化自编码器(CARA),通过在隐空间中进行投毒注入来生成投毒训练样本。仅添加1%的投毒数据,我们的实验表明,当输入假设被注入投毒签名时,被攻击的微调BERT分类器的预测可以被引导至投毒目标类,成功率超过80%,这表明NLI和文本分类系统面临巨大的安全风险。
引用
@article{arxiv.2010.02684,
title = {Poison Attacks against Text Datasets with Conditional Adversarially Regularized Autoencoder},
author = {Alvin Chan and Yi Tay and Yew-Soon Ong and Aston Zhang},
journal= {arXiv preprint arXiv:2010.02684},
year = {2020}
}
备注
Accepted in EMNLP-Findings 2020, Camera Ready Version