中文

注意文本风格!基于文本风格迁移的对抗攻击与后门攻击

计算与语言 2021-10-15 v1 人工智能 密码学与安全

摘要

对抗攻击与后门攻击是悬于深度学习之上的两种常见安全威胁。二者在实现时均利用了数据中与任务无关的特征。文本风格是一种天然与大多数 NLP 任务无关的特征,因此适用于对抗攻击与后门攻击。本文首次尝试基于文本风格迁移开展对抗攻击与后门攻击,其旨在改变句子风格的同时保留其语义。我们设计了一种对抗攻击方法与一种后门攻击方法,并进行了大量实验以评估它们。实验结果表明,流行的 NLP 模型易受基于文本风格迁移的对抗攻击与后门攻击——无需过多代价,攻击成功率即可超过 90%。这反映出 NLP 模型处理文本风格特征的能力有限,而这一点尚未被广泛认识到。此外,基于风格迁移的对抗与后门攻击方法在诸多方面优于基线方法。本文所有代码与数据可在 https://github.com/thunlp/StyleAttack 获取。

关键词

引用

@article{arxiv.2110.07139,
  title  = {Mind the Style of Text! Adversarial and Backdoor Attacks Based on Text Style Transfer},
  author = {Fanchao Qi and Yangyi Chen and Xurui Zhang and Mukai Li and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2110.07139},
  year   = {2021}
}

备注

Accepted by the main conference of EMNLP 2021 as a long paper. The camera-ready version