追踪 LLM 训练中特征动力学:一项机械化研究
机器学习
2025-06-04 v3 计算与语言
摘要
理解训练动力学和特征演化对于大型语言模型(LLM)的机械可解释性至关重要。虽然稀疏自编码器(SAEs)已被用于在 LLM 中识别特征,但这些特征在训练期间如何演化仍然尚不清晰。在本研究中,我们(1)引入 SAE-Track,一种高效获取 SAEs 连续系列的新方法,为(2)特征语义演化、(3)特征形成的底层过程以及(4)特征向量的方向漂移提供了机械化研究的基础。我们的工作为我们提供了关于 LLM 中特征动力学的新见解,增强了我们对训练机制和特征演化的理解。为可重复性,我们的代码可在 https://github.com/Superposition09m/SAE-Track 上获取。
引用
@article{arxiv.2412.17626,
title = {Tracking the Feature Dynamics in LLM Training: A Mechanistic Study},
author = {Yang Xu and Yi Wang and Hengguan Huang and Hao Wang},
journal= {arXiv preprint arXiv:2412.17626},
year = {2025}
}