中文

毒药并非无迹可寻:完全无假设的投毒攻击检测

密码学与安全 2023-10-26 v1 机器学习

摘要

机器学习模型的性能依赖于底层数据的质量。恶意行为者可通过投毒训练数据来攻击模型。当前的检测器要么绑定于特定数据类型、模型或攻击,因此在真实场景中的适用性有限。本文提出一种新颖的完全无假设框架 DIVA(Detecting InVisible Attacks,检测不可见攻击),仅通过分析与潜在被投毒的数据集来检测攻击。DIVA 基于如下思想:可通过比较分类器在投毒数据与干净数据上的准确率来检测投毒攻击,并利用复杂度度量预训练一个元学习器,以估计在假设干净数据集上否则未知的准确率。该框架适用于通用投毒攻击。出于评估目的,本文在标签翻转攻击上测试了 DIVA。

关键词

引用

@article{arxiv.2310.16224,
  title  = {Poison is Not Traceless: Fully-Agnostic Detection of Poisoning Attacks},
  author = {Xinglong Chang and Katharina Dost and Gillian Dobbie and Jörg Wicker},
  journal= {arXiv preprint arXiv:2310.16224},
  year   = {2023}
}

备注

8 pages