中文

WeDef:用于文本分类的弱监督后门防御

计算与语言 2022-11-01 v2 人工智能

摘要

现有后门防御方法仅对有限触发类型有效。为一次性防御不同触发类型,我们从中毒过程的类无关本质出发,提出一种新颖的弱监督后门防御框架 WeDef。弱监督的最新进展使得仅使用少量用户提供的、类指示性种子词训练出合理准确的文本分类器成为可能。此类种子词应被视为独立于触发器。因此,仅使用中毒文档(不带标签)训练的弱监督文本分类器很可能不含后门。受此观察启发,在 WeDef 中,我们基于弱分类器预测与中毒训练集中标签是否一致来定义样本可靠性。我们通过两阶段净化进一步改进结果:(1)基于可靠样本迭代精炼弱分类器;(2)通过区分最不可靠样本与最可靠样本训练一个二值中毒分类器。最后,我们在中毒分类器预测为良性的样本上训练净化模型。大量实验表明,WeDef 对流行的基于触发的攻击(如词、句与释义)有效,优于现有防御方法。

关键词

引用

@article{arxiv.2205.11803,
  title  = {WeDef: Weakly Supervised Backdoor Defense for Text Classification},
  author = {Lesheng Jin and Zihan Wang and Jingbo Shang},
  journal= {arXiv preprint arXiv:2205.11803},
  year   = {2022}
}