攻击者可以做得更好:模型窃取攻击中被高估与低估的因素
机器学习
2025-03-11 v1
摘要
已有研究表明,机器学习模型容易受到模型窃取攻击,从而导致知识产权侵权。在其他方法中,替代模型训练是一种适用于任何行为可通过输入-输出查询来近似逼近的机器学习模型的通用攻击方法。以往的工作主要集中在通过例如开发新的替代训练方法来提升替代模型的性能,而对攻击者能力如何影响替代模型性能的消融研究十分有限。因此,不同的作者得出了多样化、有时甚至相互矛盾的结论。在这项工作中,我们全面考察了由攻击者能力和知识变化所导致的不同因素对替代训练攻击的矛盾影响。我们的发现表明,过去被认为重要的一些因素实际上并没有那么大的影响力;相反,我们发现了攻击条件与成功率之间的新相关性。特别地,我们证明了性能更好的目标模型能够实现更高保真度的攻击,并解释了这一现象背后的直觉。此外,我们建议将焦点从目标模型的复杂性转移到其学习任务的复杂性上。因此,对于替代模型,我们建议不要一味追求更高的架构复杂性,而是应专注于获取更高复杂性的数据和合适的架构。最后,我们证明了即使在最受限的无数据场景下,也无需用数百万次查询来弥补知识的匮乏。我们的结果通常超越或匹敌以往假设攻击者具有更强能力的攻击性能,这表明这些更强的攻击可能对模型所有者的知识产权造成的危害程度远超迄今为止的预期。
引用
@article{arxiv.2503.06188,
title = {Attackers Can Do Better: Over- and Understated Factors of Model Stealing Attacks},
author = {Daryna Oliynyk and Rudolf Mayer and Andreas Rauber},
journal= {arXiv preprint arXiv:2503.06188},
year = {2025}
}
备注
This work has been accepted for publication in the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore