变形金刚藏在 Transformer 内部:基于不变谱特征检测模型复用
密码学与安全
2025-12-09 v3 人工智能
摘要
大型语言模型 (LLM) 广泛采用,其高昂的训练成本导致许多开发者选择对现有开源模型进行微调。虽然大多数人遵守开源许可证,但部分开发者错误地声称自己拥有独立训练,实际上明显派生自公开模型,这引发了关于知识产权保护和模型来源核查的迫切关切。本文提出了 GhostSpec,一种轻量且高效的 LLM 血统验证方法,无需访问训练数据或修改模型行为。我们的 approach 通过对内部注意力权重矩阵的不变乘积应用奇异值分解 (SVD) 构建紧凑且稳健的指纹。与水印或基于输出的方法不同,GhostSpec 完全数据自由、非侵入且计算高效。大量实验表明,该方法对微调、剪枝、扩展和对抗性变换均具有稳健性,能够以最小开销可靠地追溯模型来源。通过提供实用的模型验证解决方案,本方法有助于保护知识产权,推动可信赖的 LLM 生态系统的透明与可信。我们的代码已公开于 https://github.com/DX0369/GhostSpec。
引用
@article{arxiv.2511.06390,
title = {Ghost in the Transformer: Detecting Model Reuse with Invariant Spectral Signatures},
author = {Suqing Wang and Ziyang Ma and Li Xinyi and Zuchao Li},
journal= {arXiv preprint arXiv:2511.06390},
year = {2025}
}
备注
Accepted at AAAI 2026 (Oral)