中文

大语言模型的指令指纹技术

密码学与安全 2024-04-04 v2 人工智能 计算与语言 机器学习

摘要

从头训练大语言模型(LLM)的极高成本使得对模型进行指纹识别至关重要,以便通过所有权认证来保护知识产权,并确保下游用户和开发者遵守其许可条款(例如限制商业使用)。在本研究中,我们提出了一项关于 LLM 指纹识别的初步研究,其形式为一种非常轻量级的指令微调。模型发布者指定一个机密的私钥,并将其植入为指令后门,当该密钥存在时,会使 LLM 生成特定文本。在 11 个广泛使用的 LLM 上的结果表明,这种方法轻量级且不影响模型的正常行为。它还能防止发布者过度声明,保持对指纹猜测和参数高效训练的鲁棒性,并支持类似于 MIT 许可证的多阶段指纹识别。代码可在 https://cnut1648.github.io/Model-Fingerprint/ 获取。

关键词

引用

@article{arxiv.2401.12255,
  title  = {Instructional Fingerprinting of Large Language Models},
  author = {Jiashu Xu and Fei Wang and Mingyu Derek Ma and Pang Wei Koh and Chaowei Xiao and Muhao Chen},
  journal= {arXiv preprint arXiv:2401.12255},
  year   = {2024}
}

备注

Accepted at NAACL 2024; 30 pages