中文

关于数据投毒的致死剂量猜想

机器学习 2022-10-20 v3 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

数据投毒考虑出于恶意目的扭曲机器学习算法训练集的对手。本工作中,我们提出一个关于数据投毒基础的猜想,称之为致死剂量猜想。该猜想表述为:若需要 nn 个干净训练样本以实现准确预测,则在大小为 NN 的训练集中,为保证准确性只能容忍 Θ(N/n)\Theta(N/n) 个投毒样本。理论上,我们在多种情形下验证了该猜想。我们还通过分布判别给出了该猜想更一般的视角。深度划分聚合(DPA)及其扩展有限聚合(FA)是近期针对数据投毒可证明防御的方法,它们通过对使用给定学习器从训练集不同子集训练的许多基模型进行多数投票来预测。该猜想意味着 DPA 与 FA 均为(渐近)最优的——若拥有最具数据效率的学习器,它们可将其转化为最具鲁棒性的数据投毒防御之一。这勾勒出通过寻找数据高效学习器来开发更强投毒防御的实用路径。在经验上,作为概念验证,我们展示通过仅为基学习器使用不同数据增强,可分别在 CIFAR-10 与 GTSRB 上将 DPA 的认证鲁棒性翻倍和增至三倍而不牺牲准确性。

关键词

引用

@article{arxiv.2208.03309,
  title  = {Lethal Dose Conjecture on Data Poisoning},
  author = {Wenxiao Wang and Alexander Levine and Soheil Feizi},
  journal= {arXiv preprint arXiv:2208.03309},
  year   = {2022}
}

备注

36th Conference on Neural Information Processing Systems (NeurIPS 2022)