FDLLM:用于黑箱LLM指纹识别的专用探测器
密码学与安全
2026-01-21 v4 人工智能
摘要
大型语言模型(LLM)正在快速改变数字内容创建的格局。然而,许多LLM普遍采用黑箱API访问方式,带来了显著的问责、治理和安全性挑战。LLM指纹识别旨在通过分析生成文本的统计和风格特征来识别源头模型,这为可能的解决方案提供了可能性。当前领域进展受限于缺乏专用数据集以及需要高效、实用的方法,这些方法对对抗性操纵具有鲁棒性。为此,我们引入了FD-Dataset,这是一个综合性的双语指纹基准,包含来自20个著名专有和开源LLM的90,000个文本样本。进一步,我们提出FDLLM,一种新颖的指纹识别方法,利用参数高效的Low-Rank Adaptation (LoRA) 对基础模型进行微调。这种方法使LoRA能够提取刻画每个源LLM的深层持久特征。通过我们的分析,我们发现LoRA适应促进了来自同一LLM的输出在表示空间中的聚集,同时增强了不同LLM之间的分离。这一机制解释了为何LoRA特别适用于LLM指纹识别。对FD-Dataset上的广泛实证评估表明,FDLLM的优势性,其宏平均F1分数比最强基线高出22.1%。FDLLM也在新发布模型上表现出强大的泛化能力,实现95%的平均准确率。值得注意的是,FDLLM在各种对抗攻击下(包括润色、翻译和同义词替换)始终表现出稳健性。实验结果表明,FDLLM将平均攻击成功率从49.2%(LM-D)降至23.9%。
引用
@article{arxiv.2501.16029,
title = {FDLLM: A Dedicated Detector for Black-Box LLMs Fingerprinting},
author = {Zhiyuan Fu and Junfan Chen and Lan Zhang and Ting Yang and Jun Niu and Hongyu Sun and Ruidong Li and Peng Liu and Jice Wang and Fannv He and Qiuling Yue and Yuqing Zhang},
journal= {arXiv preprint arXiv:2501.16029},
year = {2026}
}