从构建到注入:面向大语言模型的基于编辑的指纹
计算与语言
2026-01-22 v3 人工智能
机器学习
摘要
建立可靠且可验证的指纹机制是控制大语言模型(LLM)未经授权再分发的基础。然而,现有方法面临两大挑战:(a)确保不可感知性,包括抵抗统计识别以及避免指纹构建过程中的意外激活;(b)在后续模型修改下同时保持模型效用和指纹可检测性。为应对这些挑战,我们提出一个端到端的指纹框架,包含两个组件。首先,我们设计了一种基于规则的代码混合指纹(CF),将类自然语言查询提示映射到多候选目标,通过高复杂度代码混合公式降低意外触发。其次,我们引入多候选编辑(MCEdit),联合优化多候选目标,并在目标输出与非目标输出之间施加间隔,以提升修改后的可检测性。大量实验表明,我们的框架为指纹保护大语言模型提供了稳健且实用的解决方案。
引用
@article{arxiv.2509.03122,
title = {From Construction to Injection: Edit-Based Fingerprints for Large Language Models},
author = {Yue Li and Xin Yi and Dongsheng Shi and Yongyi Cui and Gerard de Melo and Linlin Wang},
journal= {arXiv preprint arXiv:2509.03122},
year = {2026}
}
备注
preprint