中文

自适应吸引子:一种抵御机器学习对抗共谋攻击的防御策略

机器学习 2023-06-05 v1 密码学与安全

摘要

在机器学习模型的卖方-买方设定中,卖方基于原始模型生成不同副本并分发给不同买方,使得在某一个买方副本上生成的对抗样本很可能无法在其他副本上生效。一种已知方法使用基于吸引子的重写器实现这一点,其向不同副本注入不同吸引子,从而在不同副本中诱导出不同的对抗区域,使在一个副本上找到的对抗样本无法在其他副本上复现。本文关注多个恶意买方共谋攻击的场景。我们首先给出两种形式化描述并进行实证研究,以分析在不同攻击者能力假设与吸引子属性下共谋攻击的有效性。我们观察到,现有基于吸引子的方法不能有效误导共谋者:随着共谋者数量增加,所找到的对抗样本更多受原始模型而非吸引子影响。基于该观察,我们提出使用权重由U形曲线引导的自适应吸引子以弥补不足。实验结果表明,使用我们的方法时,即便大量副本参与共谋,共谋攻击的成功率也收敛至约15%;相比之下,使用固定权重的现有基于吸引子的重写器时,攻击成功率随共谋所用副本数量线性增长。

关键词

引用

@article{arxiv.2306.01400,
  title  = {Adaptive Attractors: A Defense Strategy against ML Adversarial Collusion Attacks},
  author = {Jiyi Zhang and Han Fang and Ee-Chien Chang},
  journal= {arXiv preprint arXiv:2306.01400},
  year   = {2023}
}