中文

通过测试时数据伪装突破非可迁移性屏障

密码学与安全 2025-03-24 v1 计算机视觉与模式识别 机器学习

摘要

非可迁移学习(NTL)已提出作为保护模型知识产权(IP)的手段,通过创建“非可迁移性屏障”来限制从授权域到未授权域的泛化。最近,一种精心设计的攻击方法通过在少量授权样本上对NTL模型进行微调,恢复了未授权域的性能,凸显了基于NTL的应用存在安全风险。然而,这种攻击需要修改模型权重,因此在黑箱场景下无效。这引出一个关键问题:我们能否信赖部署为黑箱系统的NTL模型的安全性?本文通过提出一种新颖的攻击方法(称为JailNTL),通过测试时数据伪装来突破非可迁移性屏障,从而揭示了黑箱NTL模型的首个漏洞。JailNTL的核心思想是伪装未授权数据,使其能被NTL模型识别为授权数据,从而无需修改NTL模型权重即可绕过非可迁移性屏障。具体而言,JailNTL在两个层面上鼓励未授权域的伪装,包括:(i)数据内在伪装(DID),用于在输入层消除域间差异并保留与类别相关的内容;(ii)模型引导伪装(MGD),用于缓解NTL模型输出层统计差异。经验上,在黑箱场景下攻击最先进(SOTA)NTL模型时,JailNTL仅使用1%的授权样本,即可使未授权域的准确率提高最高可达55.7%,显著超越现有SOTA白箱攻击。

关键词

引用

@article{arxiv.2503.17198,
  title  = {Jailbreaking the Non-Transferable Barrier via Test-Time Data Disguising},
  author = {Yongli Xiang and Ziming Hong and Lina Yao and Dadong Wang and Tongliang Liu},
  journal= {arXiv preprint arXiv:2503.17198},
  year   = {2025}
}

备注

Code is released at https://github.com/tmllab/2025_CVPR_JailNTL