KinGuard:防御大语言模型窃取的层级亲缘感知指纹技术
密码学与安全
2026-01-22 v2
摘要
保护大语言模型的知识产权需要稳健的所有权验证。然而,传统的后门指纹技术存在隐蔽性-鲁棒性悖论的缺陷:为了保证鲁棒性,这些方法迫使模型记忆对高困惑度触发器的固定响应,但这种针对性的过拟合会产生可检测的统计痕迹。我们用 KinGuard 解决了这一悖论,这是一个嵌入了基于结构化亲缘叙事构建的私有知识语料库的框架。模型不是记忆表面的触发器,而是通过增量预训练将这一知识内化,并通过探究其概念理解来验证所有权。大量实验证明了 KinGuard 在抵御包括微调、输入扰动和模型合并在内的一系列攻击时的卓越有效性、隐蔽性和恢复力。我们的工作将基于知识的嵌入确立为模型指纹识别的实用且安全的范式。
引用
@article{arxiv.2601.12986,
title = {KinGuard: Hierarchical Kinship-Aware Fingerprinting to Defend Against Large Language Model Stealing},
author = {Zhenhua Xu and Xiaoning Tian and Wenjun Zeng and Wenpeng Xing and Tianliang Lu and Gaolei Li and Chaochao Chen and Meng Han},
journal= {arXiv preprint arXiv:2601.12986},
year = {2026}
}
备注
Accepted by ICASSP2026