中文

面向理解自训练如何容忍数据后门投毒

机器学习 2023-01-24 v1 人工智能 密码学与安全 计算机与社会

摘要

近期关于模型训练中的后门攻击研究表明,污染一小部分训练数据就足以在投毒的测试时数据上产生错误的操纵性预测,同时在下游任务中保持较高的干净准确率。后门攻击的隐蔽性给当今机器学习范式带来了巨大的防御挑战。在本文中,我们探索利用额外无标签数据进行自训练以缓解后门攻击的潜力。我们首先进行了一项初步研究,表明原始自训练在后门缓解中并不有效。受此推动,我们提出通过在自训练伪标签阶段利用强而恰当的数据增强来防御后门攻击。我们发现这种新的自训练机制在很大程度上有助于防御后门攻击。其有效性通过在不同后门触发器上于 CIFAR-10 以及 CIFAR-10 与额外无标签 500K TinyImages 数据集组合上的实验得到证明。最后,我们探索将自监督表示学习与自训练相结合以进一步改进后门防御的方向。

关键词

引用

@article{arxiv.2301.08751,
  title  = {Towards Understanding How Self-training Tolerates Data Backdoor Poisoning},
  author = {Soumyadeep Pal and Ren Wang and Yuguang Yao and Sijia Liu},
  journal= {arXiv preprint arXiv:2301.08751},
  year   = {2023}
}

备注

Accepted at SafeAI 2023: AAAI's Workshop on Artificial Intelligence Safety