PREE: 通过知识前缀增强实现大语言模型中无害且自适应的指纹编辑
密码学与安全
2025-09-03 v1
摘要
针对大语言模型(LLM)商业部署中的知识产权保护挑战,现有黑盒指纹技术面临来自增量微调擦除和特征空间防御的双重挑战,因其依赖过拟合高困惑度触发模式。近期研究揭示,模型编辑在指纹领域具有独特优势,包括显著更低的误报率、增强的无害性以及更优的鲁棒性。在此基础上,本文创新性地提出了前缀增强指纹编辑框架(PREE),通过双通道知识编辑将版权信息编码为参数偏移,实现指纹特征的隐蔽嵌入。实验结果表明,所提方案在 LLaMA-3 和 Qwen-2.5 等主流架构中实现了 90% 的触发精度。极小的参数偏移(变化率 < 0.03)有效保持了原始知识表征,同时展现出对增量微调和多维防御策略的强大鲁棒性,在整个评估过程中保持零误报率。
引用
@article{arxiv.2509.00918,
title = {PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement},
author = {Xubin Yue and Zhenhua Xu and Wenpeng Xing and Jiahui Yu and Mohan Li and Meng Han},
journal= {arXiv preprint arXiv:2509.00918},
year = {2025}
}