中文

利用条件对抗正则化自编码器对文本数据集进行投毒攻击

计算与语言 2020-10-07 v1 人工智能 神经与进化计算

摘要

本文展示了自然语言推理(NLI)和文本分类系统中一个致命的漏洞。更具体地,我们提出了一种针对NLP模型的“后门投毒”攻击。我们的投毒攻击利用条件对抗正则化自编码器(CARA),通过在隐空间中进行投毒注入来生成投毒训练样本。仅添加1%的投毒数据,我们的实验表明,当输入假设被注入投毒签名时,被攻击的微调BERT分类器的预测可以被引导至投毒目标类,成功率超过80%,这表明NLI和文本分类系统面临巨大的安全风险。

关键词

引用

@article{arxiv.2010.02684,
  title  = {Poison Attacks against Text Datasets with Conditional Adversarially Regularized Autoencoder},
  author = {Alvin Chan and Yi Tay and Yew-Soon Ong and Aston Zhang},
  journal= {arXiv preprint arXiv:2010.02684},
  year   = {2020}
}

备注

Accepted in EMNLP-Findings 2020, Camera Ready Version