ImF:大语言模型的隐式指纹
计算与语言
2025-08-26 v3 人工智能
摘要
大型语言模型(LLM)的训练资源密集且昂贵,使得保护其知识产权(IP)至关重要。最近,向LLM中嵌入指纹以建立模型所有权已成为常见方法。然而,现有指纹技术通常嵌入弱语义连贯性的可识别模式,导致指纹与LLM固有的自然问答(question-answering, QA)行为显著不同。这种差异削弱了嵌入指纹的隐蔽性,使其易受对抗攻击。本文首先通过引入一种名为生成修订干预(Generation Revision Intervention, GRI)攻击的新型对抗攻击,展示了现有指纹嵌入方法的关键漏洞。GRI攻击利用当前指纹方法的语义脆弱性,通过干扰其弱相关的语义结构有效地擦除指纹。我们的实证评估表明,传统指纹方法在GRI攻击下受到显著削弱,揭示了其在现实对抗条件下的鲁棒性严重不足。为推动模型指纹技术的前沿进展,我们提出一种新型模型指纹范式,称为隐式指纹(Implicit Fingerprint, ImF)。ImF利用隐写术在自然文本中潜意识地嵌入所有权信息,随后通过链条思考(Chain-of-Thought, CoT)提示构建语义连贯且语境自然的QA对。这种设计确保指纹无缝集成于标准模型行为中,与常规输出无异,大幅降低意外触发和针对性删除的风险。我们在15个不同架构和规模的LLM上进行了全面评估。
引用
@article{arxiv.2503.21805,
title = {ImF: Implicit Fingerprint for Large Language Models},
author = {Jiaxuan Wu and Wanli Peng and Hang Fu and Yiming Xue and Juan Wen},
journal= {arXiv preprint arXiv:2503.21805},
year = {2025}
}
备注
13 pages, 6 figures