中文

提升防御:融合对抗训练与水印增强模型韧性

机器学习 2024-01-09 v2 密码学与安全

摘要

机器学习模型正被用于越来越多的关键应用;因此,保护其完整性和所有权至关重要。最近的研究观察到对抗训练和水印之间存在冲突的相互作用。本文引入了一个新颖的框架,将对抗训练与水印技术相结合,以增强对逃避攻击的防御能力,并在知识产权被盗时提供可靠的模型验证。我们使用对抗训练和对抗水印来训练一个鲁棒的水印模型。关键直觉是使用比对抗训练预算更高的扰动预算来生成对抗水印,从而避免冲突。我们使用MNIST和Fashion-MNIST数据集在各种模型窃取攻击上评估了我们提出的技术。获得的结果在鲁棒性性能方面始终优于现有基线,并进一步证明了这种防御对剪枝和微调移除攻击的韧性。

关键词

引用

@article{arxiv.2312.14260,
  title  = {Elevating Defenses: Bridging Adversarial Training and Watermarking for Model Resilience},
  author = {Janvi Thakkar and Giulio Zizzo and Sergio Maffeis},
  journal= {arXiv preprint arXiv:2312.14260},
  year   = {2024}
}

备注

Accepted at DAI Workshop, AAAI 2024