SeedPrints:指纹甚至能揭示你的大语言模型源自哪个种子
密码学与安全
2026-04-15 v2 人工智能
计算与语言
摘要
对大语言模型(LLM)进行指纹识别对于溯源验证和模型归属至关重要。现有的指纹识别方法主要在微调后进行评估,此时模型已从训练数据、优化动态或超参数中获得了稳定的签名。然而,模型的大部分能力和知识是在预训练而非下游微调阶段获得的,这使得大规模预训练成为谱系验证更为根本的场景。我们发现,现有的指纹识别方法在此场景下变得不可靠,因为它们依赖于仅在大量训练后才出现的后验签名。这一局限性与高尔顿关于指纹作为内在且持久身份的经典概念相悖。相比之下,我们提出了一种更强且更内在的LLM指纹识别概念:SeedPrints,该方法利用随机初始化偏差作为持久、依赖种子的标识符,这些标识符甚至在训练开始前就已存在。我们证明,未训练的模型会表现出由其初始化种子引起的可复现预测偏差,并且这些微弱信号在整个训练过程中保持统计可检测性,从而实现高置信度的谱系验证。与在早期预训练阶段失效或在分布偏移下退化的先前技术不同,SeedPrints在从初始化到大规模预训练及下游适应的所有训练阶段均保持有效。在LLaMA风格和Qwen风格模型上的实验证明了种子级别的可区分性,并实现了从诞生到全生命周期的身份验证。对大规模预训练轨迹和真实世界指纹识别基准的评估进一步证实了其在长时间训练、领域偏移和参数修改下的鲁棒性。
引用
@article{arxiv.2509.26404,
title = {SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From},
author = {Yao Tong and Haonan Wang and Siquan Li and Kenji Kawaguchi and Tianyang Hu},
journal= {arXiv preprint arXiv:2509.26404},
year = {2026}
}
备注
Accepted to ICLR 2026. The code repository linked on OpenReview is outdated; the latest code is available via the final arXiv version