用于 LLM 相似性检测与家族分类的基于梯度的模型指纹识别
机器学习
2025-07-04 v2 人工智能
软件工程
摘要
随着大语言模型(LLM)成为现代应用中的核心软件组件,通过微调、合并和再分发产生的未授权模型衍生已成为关键的软件工程挑战。不同于传统软件中已建立完善的克隆检测与许可证合规机制,LLM 生态系统缺乏有效的机制来检测模型谱系并执行许可协议。当 Meta 的 LLaMA 等开源模型创作者要求衍生作品保留命名约定以进行归属标注,却无技术手段验证合规性时,这一空白尤为棘手。为填补这一空白,我们将 LLM 视为需要溯源追踪的软件制品,提出了 TensorGuard,一个用于 LLM 相似性检测与家族分类的基于梯度的指纹识别框架。该方法通过分析张量层对随机输入扰动的梯度响应来提取模型固有的行为特征,独立于训练数据、水印或特定模型格式。TensorGuard 支持广泛采用的 safetensors 格式,并通过对梯度特征的统计分析构建高维指纹。这些指纹支持两项互补能力:通过距离计算对任意模型进行直接的成对相似性评估,以及使用 K-Means 聚类算法并利用已知基础模型进行领域知识质心初始化,对未知模型进行系统性的家族分类。在包含 8 个基础模型和跨越五个模型家族(Llama、Qwen、Gemma、Phi、Mistral)的 50 个衍生模型共 58 个模型上的实验评估表明,在我们质心初始化的 K-Means 聚类下实现了 94% 的分类准确率。
引用
@article{arxiv.2506.01631,
title = {Gradient-Based Model Fingerprinting for LLM Similarity Detection and Family Classification},
author = {Zehao Wu and Yanjie Zhao and Haoyu Wang},
journal= {arXiv preprint arXiv:2506.01631},
year = {2025}
}