中文

针对数据投毒的时间鲁棒性

机器学习 2023-12-08 v3 人工智能 密码学与安全 机器学习

摘要

数据投毒考虑攻击者通过恶意训练数据操纵机器学习算法行为的情形。现有的数据投毒威胁模型围绕单一指标——投毒样本数量——展开。因此,如果攻击者能以可承受的开销投毒比预期更多的样本(正如许多实际场景中所发生的),他们可能在短时间内使现有防御失效。为解决此问题,我们利用表示数据生成时间的时间戳,这些时间戳通常可用但在过去被忽视。借助这些时间戳,我们提出了一种具有两个新指标——早期性(earliness)和持续性(duration)——的数据投毒时间威胁模型,它们分别衡量攻击提前开始的时长和攻击持续的时长。利用这些指标,我们定义了针对数据投毒的时间鲁棒性概念,即使在投毒样本数量无界但攻击在时间上有界时,也提供有意义的保护感。我们提出了一个基准及模拟连续数据收集和周期性部署更新模型的评估协议,从而实现对时间鲁棒性的经验评估。最后,我们开发并经验验证了一种基线防御,即时间聚合(temporal aggregation),提供可证明的时间鲁棒性,并凸显了我们数据投毒时间威胁模型的潜力。

关键词

引用

@article{arxiv.2302.03684,
  title  = {Temporal Robustness against Data Poisoning},
  author = {Wenxiao Wang and Soheil Feizi},
  journal= {arXiv preprint arXiv:2302.03684},
  year   = {2023}
}

备注

37th Conference on Neural Information Processing Systems (NeurIPS 2023)