中文

面向大型语言模型版权验证的隐形且稳健的对抗指纹(SRAF)

密码学与安全 2026-05-28 v4

摘要

随着大型语言模型(LLM)的普及应用,版权知识产权保护已成为关键关注议题。尽管对抗指纹技术为所有权验证提供了有前景的黑箱解决方案,但现有方法存在显著局限:其对下游模型修改极其脆弱,对系统提示变化敏感,且因高perplexity输入模式易被检测到。本文提出了SRAF(Stealthy and Robust Adversarial Fingerprint,隐形且稳健的对抗指纹),SRAF采用跨相似模型变体和多样化聊天模板的联合优化策略,迫使指纹锚定于模型家族的不变内在理解特征上。进而引入Perplexity Hiding技术,将对抗扰动嵌入Markdown表格中,有效使提示统计与自然语言一致,规避基于perplexity的检测。针对Llama-2模型系列进行大量实验表明,SRAF在针对微调、对齐、剪枝、合并和输入扰动方面显著提升了鲁棒性,同时保持卓越的隐形性和低误报率,为LLM所有权验证提供了实用且持久的黑箱解决方案。

关键词

引用

@article{arxiv.2505.06304,
  title  = {SRAF: Stealthy and Robust Adversarial Fingerprint for Copyright Verification of Large Language Models},
  author = {Zhebo Wang and Zhenhua Xu and Maike Li and Wenpeng Xing and Chunqiang Hu and Chen Zhi and Meng Han},
  journal= {arXiv preprint arXiv:2505.06304},
  year   = {2026}
}