大型语言模型发展解释性研究综述
计算与语言
2025-08-25 v1 机器学习
摘要
本综述综合了新兴但关键的大型语言模型发展解释性领域。我们描绘了该领域从静态、事后分析训练模型向对训练过程本身动态调查的演变。我们首先调查了基础方法,包括表征探测、因果追踪和电路分析,使研究人员能够解构学习过程。本综述的核心部分详述了 LLM 能力的发展轨迹,详细阐述了计算电路的形成与组成、知识获取的双相性质、学习策略如零样本学习的瞬时动力学,以及作为训练中相位转变的涌现能力现象。我们探讨了与人类认知和语言发展的 illuminating 类似性,这为理解 LLM 学习提供了宝贵的概念框架。最后,我们认为,这种发展视角不仅是一种学术练习,而是主动 AI 安全的基石,为预测、监控和对齐模型获取其能力的过程提供了路径。我们总结了该领域面临的宏大挑战,如可扩展性和自动化,并提出了构建更透明、可靠且有益的 AI 系统的研究议程。
引用
@article{arxiv.2508.15841,
title = {A Review of Developmental Interpretability in Large Language Models},
author = {Ihor Kendiukhov},
journal= {arXiv preprint arXiv:2508.15841},
year = {2025}
}