知识的诞生:大型语言模型中跨时间、空间与尺度的涌现特征
计算与语言
2025-05-27 v1 机器学习
摘要
本文研究大型语言模型(LLM)中可解释类别特征的涌现,分析它们在训练检查点(时间)、Transformer 层(空间)和不同模型规模(尺度)下的行为。利用稀疏自编码器进行机制可解释性分析,我们确定了特定语义概念在神经激活中出现的时间和位置。结果表明,在多个领域中,特征涌现存在明确的时间阈值和尺度特定阈值。值得注意的是,空间分析揭示了出乎意料的语义重激活现象,即早期层的特征在后期层重新出现,这挑战了关于 Transformer 模型表征动态的标准假设。
引用
@article{arxiv.2505.19440,
title = {The Birth of Knowledge: Emergent Features across Time, Space, and Scale in Large Language Models},
author = {Shashata Sawmya and Micah Adler and Nir Shavit},
journal= {arXiv preprint arXiv:2505.19440},
year = {2025}
}