中文

MSDT:文本域中基于掩码语言模型评分的防御方法

计算与语言 2022-11-22 v1

摘要

预训练语言模型使我们能够借助微调来处理下游任务,这有助于模型在各种自然语言处理(NLP)任务中达到相当高的准确率。从各网站轻易下载到的此类语言模型,赋能了普通用户及一些主要机构,推动了其现实应用的势头。然而,最近已被证明,当模型被恶意用户利用插入触发器的中毒数据集进行后门攻击时,会变得极其脆弱。攻击者随后将受害模型重新分发给公众以吸引其他用户使用,当训练样本中检测到特定触发器时,这些模型往往会发生误分类。在本文中,我们将介绍一种新颖的改进文本后门防御方法,命名为MSDT,它在特定数据集上的表现优于现有的防御算法。实验结果表明,我们的方法在防御文本域后门攻击方面是有效且具建设性的。代码可在 https://github.com/jcroh0508/MSDT 获取。

关键词

引用

@article{arxiv.2211.05371,
  title  = {MSDT: Masked Language Model Scoring Defense in Text Domain},
  author = {Jaechul Roh and Minhao Cheng and Yajun Fang},
  journal= {arXiv preprint arXiv:2211.05371},
  year   = {2022}
}

备注

5 pages, 1 figure, 4 tables, accepted as a conference paper at IEEE UV 2022, Boston, USA