探索基石模型的威胁景观:模型窃取
计算机视觉与模式识别
2025-04-16 v1 密码学与安全
机器学习
摘要
计算机视觉的基石模型(FMs)学习到丰富且稳健的表征,使其能够通过少量甚至无需微调即可适用于任务/领域特定的部署。然而,我们认为正是这种优势本身也会使基于FMs的应用暴露于模型窃取攻击之下。通过实证分析,我们揭示了从FMs微调的模型对模型窃取的易感性高于常规视觉架构如ResNet。我们假设这种行为是由于FMs在预训练期间学习到的全面视觉模式和特征——这些特征对攻击者和受害者都是可访问的。我们报告称,当使用ViT-L/16作为窃取模型时,针对在CIFAR-10数据集上训练的ViT-L/16受害模型,窃取者能够获得94.28%的一致性(匹配预测结果),而ResNet-18受害模型仅为73.20%。我们首次表明,针对下游任务利用FMs可能并非在商业API中部署的最佳选择,因为其对模型盗窃的脆弱性。我们因此提醒模型所有者关注相关安全风险,并强调需要 robust 安全措施来保护这些模型免受窃取。代码已公开于https://github.com/rajankita/foundation_model_stealing。
引用
@article{arxiv.2502.18077,
title = {Examining the Threat Landscape: Foundation Models and Model Stealing},
author = {Ankita Raj and Deepankar Varma and Chetan Arora},
journal= {arXiv preprint arXiv:2502.18077},
year = {2025}
}
备注
Accepted to BMVC 2024