中文

Kallima:一种用于文本后门攻击的干净标签框架

密码学与安全 2022-06-07 v1 计算与语言

摘要

尽管深度神经网络(DNN)在各种自然语言处理(NLP)任务中取得了前所未有的进展,研究表明深度模型极易受到后门攻击。现有后门攻击主要向训练数据集中注入少量标签被改为目标类的有毒样本。此类错标样本在人工审查时会引起怀疑,从而可能暴露攻击。为提升文本后门攻击的隐蔽性,我们提出首个干净标签框架Kallima,用于合成拟态风格的后门样本以发起阴险的文本后门攻击。我们利用对抗扰动修改属于目标类的输入,使模型更依赖于后门触发器。我们的框架与大多数现有后门触发器兼容。在三个基准数据集上的实验结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2206.01832,
  title  = {Kallima: A Clean-label Framework for Textual Backdoor Attacks},
  author = {Xiaoyi Chen and Yinpeng Dong and Zeyu Sun and Shengfang Zhai and Qingni Shen and Zhonghai Wu},
  journal= {arXiv preprint arXiv:2206.01832},
  year   = {2022}
}