大型语言模型的自然指纹
计算与语言
2025-09-22 v2
摘要
近期研究表明,来自大型语言模型(LLM)的输出往往能揭示其来源模型的身份。虽然这源于LLM对训练数据分布的建模,但这些可识别的痕迹也可能反映出意外的特征,潜在影响公平性和滥用问题。本文进一步表明,即使在完全相同的训练数据集上训练,LLM的输出仍保持可区分性,这表明训练动态本身即可留下可被识别的模式。我们称这些意外而独特的特征为自然指纹。通过系统控制训练条件,我们展示,自然指纹可从训练过程中细微差异中产生,包括参数规模、优化设置甚至随机种子。这些结果表明,训练动态独立于数据或架构,能够系统性地塑造模型行为,未来研究在透明度、可靠性和可解释性方面应予以明确考虑。
引用
@article{arxiv.2504.14871,
title = {Natural Fingerprints of Large Language Models},
author = {Teppei Suzuki and Ryokan Ri and Sho Takase},
journal= {arXiv preprint arXiv:2504.14871},
year = {2025}
}