English

AttnDiff: Attention-based Differential Fingerprinting for Large Language Models

Cryptography and Security 2026-04-08 v1 Machine Learning

Abstract

Protecting the intellectual property of open-weight large language models (LLMs) requires verifying whether a suspect model is derived from a victim model despite common laundering operations such as fine-tuning (including PPO/DPO), pruning/compression, and model merging. We propose \textsc{AttnDiff}, a data-efficient white-box framework that extracts fingerprints from models via intrinsic information-routing behavior. \textsc{AttnDiff} probes minimally edited prompt pairs that induce controlled semantic conflicts, captures differential attention patterns, summarizes them with compact spectral descriptors, and compares models using CKA. Across Llama-2/3 and Qwen2.5 (3B--14B) and additional open-source families, it yields high similarity for related derivatives while separating unrelated model families (e.g., >0.98>0.98 vs.\ <0.22<0.22 with M=60M=60 probes). With 5--60 multi-domain probes, it supports practical provenance verification and accountability.

Keywords

Cite

@article{arxiv.2604.05502,
  title  = {AttnDiff: Attention-based Differential Fingerprinting for Large Language Models},
  author = {Haobo Zhang and Zhenhua Xu and Junxian Li and Shangfeng Sheng and Dezhang Kong and Meng Han},
  journal= {arXiv preprint arXiv:2604.05502},
  year   = {2026}
}

Comments

Accepted at ACL2026 Main

R2 v1 2026-07-01T11:56:47.755Z