中文

SELF:用于LLM指纹识别的鲁棒奇异值与特征值方法

密码学与安全 2025-12-04 v1 人工智能 计算与语言 机器学习

摘要

大型语言模型(LLMs)的知识产权(IP)保护是当代AI研究中的关键挑战。虽然指纹技术已作为检测未经授权模型使用的基本机制出现,但现有方法——无论是基于行为的还是基于结构的——都存在漏洞,如虚假声明攻击或易受权重操作的影响。为克服这些局限,我们提出SELF,一种新颖的基于权重的内在指纹方案,消除了对输入的依赖并天然抵抗虚假声明。SELF通过两项关键创新实现鲁棒的IP保护:1)通过LLM注意力权重的奇异值分解和特征值分解提取唯一、可扩展且变换不变的指纹;2)基于少样本学习和数据增强的有效神经网络指纹相似度比较。实验结果表明,SELF在保持高IP侵权检测准确率的同时,对各种下游修改(包括量化、剪枝和微调攻击)展现出强鲁棒性。我们的代码可在https://github.com/HanxiuZhang/SELF_v2获取。

关键词

引用

@article{arxiv.2512.03620,
  title  = {SELF: A Robust Singular Value and Eigenvalue Approach for LLM Fingerprinting},
  author = {Hanxiu Zhang and Yue Zheng},
  journal= {arXiv preprint arXiv:2512.03620},
  year   = {2025}
}