中文

用于改进干净标签后门攻击的战略样本选择

密码学与安全 2025-08-25 v1 人工智能 机器学习

摘要

后门攻击构成了文本分类模型在自然语言处理中完整性的重大威胁。虽然已提出多种实现高攻击成功率(ASR)的污染标签攻击方法,但干净标签攻击本质上更为困难。本文提出三种样本选择策略以提高干净标签情景下的攻击效果:Minimum、Above50 和 Below50。我们的策略识别模型预测错误或置信度低的样本,通过注入后门触发器于此类样本中,以增强触发器模式与攻击者期望目标标签之间的关联。我们将方法应用于干净标签变体的四种经典后门攻击(InsertSent、WordInj、StyleBkd、SynBkd),在三个数据集(IMDB、SST2、HateSpeech)和四种模型类型(LSTM、BERT、DistilBERT、RoBERTa)上进行评估。结果表明,所提策略,尤其是 Minimum 策略,相对于随机样本选择在 ASR 上显著提升,且对模型干净准确率几乎没有或没有恶化。此外,本文提出的策略在许多配置下均优于当前最先进的干净标签攻击方法 BITE。

关键词

引用

@article{arxiv.2508.15934,
  title  = {Strategic Sample Selection for Improved Clean-Label Backdoor Attacks in Text Classification},
  author = {Onur Alp Kirci and M. Emre Gursoy},
  journal= {arXiv preprint arXiv:2508.15934},
  year   = {2025}
}