中文

基于分类自编码器的检测器应对多样化数据投毒攻击

机器学习 2024-10-28 v2

摘要

投毒攻击是一类对抗性机器学习威胁,攻击者试图通过将精心制作的数据注入训练数据集来破坏机器学习系统的结果,从而增加机器学习模型的测试误差。攻击者可以篡改数据特征空间、数据标签或两者兼有,每一种都会导致具有不同强度的不同攻击策略。最近出现了各种检测方法,每种方法都侧重于一种攻击策略。许多此类检测方法的致命弱点是它们依赖于对干净、未篡改数据集的访问。在本文中,我们提出了 CAE,一种基于分类自编码器的检测器,用于应对多样化的投毒数据。CAE 可以利用重构和分类误差的组合来检测所有形式的投毒攻击,而无需具备任何关于攻击策略的先验知识。我们表明,CAE 的增强版本(称为 CAE+)无需使用干净数据集来训练防御模型。我们在三个真实数据集 MNIST、Fashion-MNIST 和 CIFAR 上的实验结果表明,我们提出的方法在高达 30% 的受污染数据下仍能保持其功能,并帮助受防御的 SVM 分类器恢复其最佳准确率。

关键词

引用

@article{arxiv.2108.04206,
  title  = {Classification Auto-Encoder based Detector against Diverse Data Poisoning Attacks},
  author = {Fereshteh Razmi and Li Xiong},
  journal= {arXiv preprint arXiv:2108.04206},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication