大语言模型的指令指纹技术
密码学与安全
2024-04-04 v2 人工智能
计算与语言
机器学习
摘要
从头训练大语言模型(LLM)的极高成本使得对模型进行指纹识别至关重要,以便通过所有权认证来保护知识产权,并确保下游用户和开发者遵守其许可条款(例如限制商业使用)。在本研究中,我们提出了一项关于 LLM 指纹识别的初步研究,其形式为一种非常轻量级的指令微调。模型发布者指定一个机密的私钥,并将其植入为指令后门,当该密钥存在时,会使 LLM 生成特定文本。在 11 个广泛使用的 LLM 上的结果表明,这种方法轻量级且不影响模型的正常行为。它还能防止发布者过度声明,保持对指纹猜测和参数高效训练的鲁棒性,并支持类似于 MIT 许可证的多阶段指纹识别。代码可在 https://cnut1648.github.io/Model-Fingerprint/ 获取。
引用
@article{arxiv.2401.12255,
title = {Instructional Fingerprinting of Large Language Models},
author = {Jiashu Xu and Fei Wang and Mingyu Derek Ma and Pang Wei Koh and Chaowei Xiao and Muhao Chen},
journal= {arXiv preprint arXiv:2401.12255},
year = {2024}
}
备注
Accepted at NAACL 2024; 30 pages