StolenLoRA:基于合成数据的 LoRA 提取攻击探索
密码学与安全
2025-09-30 v1 计算机视觉与模式识别
摘要
参数高效微调(PEFT)方法如LoRA已改变视觉模型适应方式,使快速部署定制模型成为可能。然而,LoRA适配器的紧凑性带来新的安全隐患,尤其是其对模型提取攻击的脆弱性。本文引入了新的模型提取攻击方向,即LoRA提取,该方法基于公共预训练模型提取LoRA适配模型。我们随后提出一种新型提取方法StolenLoRA,其通过训练替代模型来提取LoRA适配模型的功能,利用合成数据。StolenLoRA利用大型语言模型设计有效提示生成数据,并纳入不信任半监督学习(DSL)策略以从有限查询中最大化信息获取。我们的实验表明,StolenLoRA有效率地完成了提取工作,在仅使用1万查询的情况下即可实现最高96.60%的攻击成功率,即使在攻击者和受害模型使用不同预训练骨干网络的跨骨干场景下亦如此。这些发现揭示了LoRA适配模型对此类提取攻击的特定脆弱性,凸显了针对PEFT方法构建鲁健防御机制的紧迫需求。我们还探索了一种基于多样化LoRA部署的初步防御策略,突显了其抑制此类攻击的潜力。
引用
@article{arxiv.2509.23594,
title = {StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data},
author = {Yixu Wang and Yan Teng and Yingchun Wang and Xingjun Ma},
journal= {arXiv preprint arXiv:2509.23594},
year = {2025}
}
备注
ICCV 2025