中文

大型语言模型的自然指纹

计算与语言 2025-09-22 v2

摘要

近期研究表明,来自大型语言模型(LLM)的输出往往能揭示其来源模型的身份。虽然这源于LLM对训练数据分布的建模,但这些可识别的痕迹也可能反映出意外的特征,潜在影响公平性和滥用问题。本文进一步表明,即使在完全相同的训练数据集上训练,LLM的输出仍保持可区分性,这表明训练动态本身即可留下可被识别的模式。我们称这些意外而独特的特征为自然指纹。通过系统控制训练条件,我们展示,自然指纹可从训练过程中细微差异中产生,包括参数规模、优化设置甚至随机种子。这些结果表明,训练动态独立于数据或架构,能够系统性地塑造模型行为,未来研究在透明度、可靠性和可解释性方面应予以明确考虑。

关键词

引用

@article{arxiv.2504.14871,
  title  = {Natural Fingerprints of Large Language Models},
  author = {Teppei Suzuki and Ryokan Ri and Sho Takase},
  journal= {arXiv preprint arXiv:2504.14871},
  year   = {2025}
}