中文

小型 Transformer 语言模型中的相位转变证据

计算与语言 2025-11-18 v1 人工智能

摘要

相位转变被提议为大型语言模型(LLM)中新兴能力的来源,当模型规模超过特定阈值后,新能力会突然出现。先前的工作,例如 Wei 等人的工作,在模型和数据规模方面展示了这些现象,通过对训练计算应用对数尺度后揭示了转变。本文我们提出三个互补问题:(1)相位转变是否独特于大型模型,还是也可在小型基于 Transformer 的语言模型中观察到?(2)这些转变能否直接在线性训练空间中检测,而不是仅在对数缩放后才显现?(3)这些转变能否在训练早期出现?为调查这些问题,我们在字符级别语料库上训练一个小型 GPT 风格 Transformer,并分析词汇使用随时间的演变。我们跟踪平均词长、正确单词数与错误单词数的比例,以及词汇多样性的变化。基于这些措施,我们应用泊松分布和亚泊松分布统计来量化单词如何连接和重新组织。这种组合分析揭示了训练期间的明确转变点。值得注意的是,这些转变在标准损失或验证曲线中并不明显,但通过我们的基于词汇和统计的探针方法才显现出来。我们的发现表明,相位转变重组织是语言模型训练的普遍特征,即使在适度的模型中也可被观察到,可以直接在线性训练空间中检测,并且在一致性出现时就已发生。这一视角为理解语言模型训练的非线性动力学提供了新视角,并强调了针对发现相位转变行为的重要性。

关键词

引用

@article{arxiv.2511.12768,
  title  = {Evidence of Phase Transitions in Small Transformer-Based Language Models},
  author = {Noah Hong and Tao Hong},
  journal= {arXiv preprint arXiv:2511.12768},
  year   = {2025}
}