中文

FPEdit:通过局部参数编辑实现稳健的大语言模型指纹识别

密码学与安全 2025-10-20 v2 人工智能

摘要

大型语言模型代表了巨大的计算、数据和工程专业知识的投入,使其成为极其珍贵的知识产权。然而,这些AI资产仍然通过微调或黑盒部署方式面临未经授权的再分发和商业滥用。当前的指纹识别方法面临根本性的权衡:内置方法需要完全的参数访问,而基于后门的技术则使用容易被对手检测和过滤的统计异常触发器。为解决这些限制,我们引入FPEdit,一种新型框架,利用知识编辑将通过稀疏、针对性修改模型权重来注入语义连贯的自然语言指纹。我们的方法引入了“提升-抑制价值向量优化”,在增强目标词概率的同时抑制竞争词,确保指纹稳健集成且不损害核心模型功能。大量实验表明,FPEdit在完全参数微调和参数高效适应情况下均实现95-100%的指纹保留,同时保持下游基准的性能。此外,FPEdit在量化、剪枝和随机解码下仍保持稳健性,且可在30GB以下的GPU内存内将10对指纹嵌入LLaMA2-7B,耗时不足2分钟,这标志着资源需求的显著降低。这些进展使FPEdit成为首个在适应性、检测抵抗和模型实用性之间实现同步的指纹识别方法,为面向对抗部署场景中大语言模型可靠来源验证提供了 minimally 感知的解决方案。

关键词

引用

@article{arxiv.2508.02092,
  title  = {FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing},
  author = {Shida Wang and Chaohu Liu and Yubo Wang and Linli Xu},
  journal= {arXiv preprint arXiv:2508.02092},
  year   = {2025}
}