中文

知识的诞生:大型语言模型中跨时间、空间与尺度的涌现特征

计算与语言 2025-05-27 v1 机器学习

摘要

本文研究大型语言模型(LLM)中可解释类别特征的涌现,分析它们在训练检查点(时间)、Transformer 层(空间)和不同模型规模(尺度)下的行为。利用稀疏自编码器进行机制可解释性分析,我们确定了特定语义概念在神经激活中出现的时间和位置。结果表明,在多个领域中,特征涌现存在明确的时间阈值和尺度特定阈值。值得注意的是,空间分析揭示了出乎意料的语义重激活现象,即早期层的特征在后期层重新出现,这挑战了关于 Transformer 模型表征动态的标准假设。

关键词

引用

@article{arxiv.2505.19440,
  title  = {The Birth of Knowledge: Emergent Features across Time, Space, and Scale in Large Language Models},
  author = {Shashata Sawmya and Micah Adler and Nir Shavit},
  journal= {arXiv preprint arXiv:2505.19440},
  year   = {2025}
}