中文

通过向不同用户分发不同副本缓解对抗攻击

密码学与安全 2023-05-29 v3 机器学习

摘要

机器学习模型易受对抗攻击。在本文中,我们考虑将模型分发给多个买家、其中恶意买家试图攻击另一买家的场景。恶意买家探测其所持有的模型副本以搜索对抗样本,随后将这些发现的样本呈现给受害者的模型副本以复现攻击。我们指出,通过向不同买家分发不同的模型副本,可缓解此类攻击,使得在一个副本上发现的对抗样本无法在另一副本上生效。我们观察到,以不同随机性训练模型确实在一定程度上缓解了此类复现,但并无保证且重训练计算开销大。若干工作扩展了重训练方法以增强模型间差异,然而此类方法可生成的模型数量非常有限且计算成本更高。因此,我们提出一种直接修改模型参数的灵活参数重写方法。该方法无需额外训练,能够以更可控的方式生成大量副本,每个副本诱导不同的对抗区域。实验研究表明,重写能在保持高分类准确率的同时显著缓解攻击。例如,在 GTSRB 数据集上针对 Hop Skip Jump 攻击,使用基于吸引子的重写器可将攻击复现成功率降至 0.5%,而以不同随机性独立训练副本仅能降至 6.5%。从本研究中,我们认为有许多进一步方向值得探索。

关键词

引用

@article{arxiv.2111.15160,
  title  = {Mitigating Adversarial Attacks by Distributing Different Copies to Different Users},
  author = {Jiyi Zhang and Han Fang and Wesley Joon-Wie Tann and Ke Xu and Chengfang Fang and Ee-Chien Chang},
  journal= {arXiv preprint arXiv:2111.15160},
  year   = {2023}
}