中文

UTF:Undertrained Tokens 作为指纹——一种新的大语言模型识别方法

密码学与安全 2025-07-15 v2 人工智能

摘要

对大型语言模型(LLM)进行指纹化是确保模型所有权、验证真实性和防止滥用的关键。传统的指纹化方法通常需要较大的计算开销或白盒验证访问权限。本文介绍了一种新颖且高效的方法,通过利用未完全训练的标记(undertrained tokens)来进行LLM指纹化。未完全训练的标记是模型在训练阶段未完全学习的标记。通过利用这些标记,我们进行受监督的微调,将特定的输入输出对嵌入模型。这一过程允许LLM在呈现特定输入时产生预定输出,从而有效地嵌入唯一的指纹。我们的方法对模型性能影响最小,不需要对目标模型的所有权进行白盒访问。与现有的指纹化方法相比,UTF在微调和随机猜测方面更有效且更稳健。

关键词

引用

@article{arxiv.2410.12318,
  title  = {UTF:Undertrained Tokens as Fingerprints A Novel Approach to LLM Identification},
  author = {Jiacheng Cai and Jiahao Yu and Yangguang Shao and Yuhang Wu},
  journal= {arXiv preprint arXiv:2410.12318},
  year   = {2025}
}