ProDiF:保护领域不变特征以保护预训练模型免受提取攻击
密码学与安全
2025-03-18 v1 机器学习
摘要
预训练模型是宝贵的知识产权,在其权重空间中捕获了领域特定特征和领域不变特征。然而,模型提取攻击通过利用领域不变特征,实现未授权的源域推理并促进跨域迁移,从而威胁这些资产。在本工作中,我们引入了 **ProDiF**,一种利用针对性权重空间操作来保护预训练模型免受提取攻击的新框架。**ProDiF** 量化滤波器的可迁移性,并扰动不安全内存中关键滤波器的权重,同时在可信执行环境(TEE)中为授权用户保留实际的关键权重。双层优化进一步确保了针对自适应微调攻击的鲁棒性。实验结果表明,**ProDiF** 将源域准确率降低至接近随机水平,并将跨域可迁移性降低 74.65%,为预训练模型提供了鲁棒保护。这项工作为预训练 DNN 模型提供了全面保护,并突显了权重空间操作作为模型安全新方法的潜力。
引用
@article{arxiv.2503.13224,
title = {ProDiF: Protecting Domain-Invariant Features to Secure Pre-Trained Models Against Extraction},
author = {Tong Zhou and Shijin Duan and Gaowen Liu and Charles Fleming and Ramana Rao Kompella and Shaolei Ren and Xiaolin Xu},
journal= {arXiv preprint arXiv:2503.13224},
year = {2025}
}
备注
Accepted at the ICLR Workshop on Neural Network Weights as a New Data Modality 2025