SnatchML:无需训练访问权限的机器学习模型劫持
密码学与安全
2025-04-15 v2 计算机视觉与模式识别
机器学习
摘要
模型劫持可能引发重大的问责与安全风险,因为被劫持模型的所有者可能被诬陷其模型提供了非法或不道德的服务。先前的工作将模型劫持视为一种训练时攻击,其中攻击者需要完全访问ML模型的训练过程。在本文中,我们考虑了一种用于推理时劫持攻击的更强威胁模型,其中攻击者无法访问受害模型的训练阶段。我们的直觉是,通常过度参数化的ML模型可能有能力(无意地)学习超出其训练目标任务的内容。我们提出了SnatchML,一种新的免训练模型劫持攻击,它利用受害模型学到的额外容量来推断与原始任务在语义上相关或不相关的不同任务。我们在部署于AWS Sagemaker的模型上的结果表明,SnatchML在劫持任务上能够提供高准确率。有趣的是,尽管所有先前的方法都受到良性任务中类别数量的限制,SnatchML可以劫持模型执行包含比原始任务更多类别的任务。我们探索了缓解此风险的不同方法;我们提出了元反学习(meta-unlearning),旨在帮助模型在训练原始任务时反学习潜在的恶意任务。我们还提供了关于过度参数化作为促进模型劫持的可能内在因素的见解,并据此提出了一种基于压缩的对策来抵御这种攻击。我们相信这项工作为模型劫持攻击提供了一个先前被忽视的视角,提出了更强的威胁模型和更高的现实世界适用性。
引用
@article{arxiv.2406.01708,
title = {SnatchML: Hijacking ML models without Training Access},
author = {Mahmoud Ghorbel and Halima Bouzidi and Ioan Marius Bilasco and Ihsen Alouani},
journal= {arXiv preprint arXiv:2406.01708},
year = {2025}
}
备注
17 pages, 14 figures, 7 tables