中文

从构建到注入:面向大语言模型的基于编辑的指纹

计算与语言 2026-01-22 v3 人工智能 机器学习

摘要

建立可靠且可验证的指纹机制是控制大语言模型(LLM)未经授权再分发的基础。然而,现有方法面临两大挑战:(a)确保不可感知性,包括抵抗统计识别以及避免指纹构建过程中的意外激活;(b)在后续模型修改下同时保持模型效用和指纹可检测性。为应对这些挑战,我们提出一个端到端的指纹框架,包含两个组件。首先,我们设计了一种基于规则的代码混合指纹(CF),将类自然语言查询提示映射到多候选目标,通过高复杂度代码混合公式降低意外触发。其次,我们引入多候选编辑(MCEdit),联合优化多候选目标,并在目标输出与非目标输出之间施加间隔,以提升修改后的可检测性。大量实验表明,我们的框架为指纹保护大语言模型提供了稳健且实用的解决方案。

关键词

引用

@article{arxiv.2509.03122,
  title  = {From Construction to Injection: Edit-Based Fingerprints for Large Language Models},
  author = {Yue Li and Xin Yi and Dongsheng Shi and Yongyi Cui and Gerard de Melo and Linlin Wang},
  journal= {arXiv preprint arXiv:2509.03122},
  year   = {2026}
}

备注

preprint