将Transformer建模为复杂网络以分析学习动力学
机器学习
2025-09-22 v1 人工智能
摘要
大型语言模型(LLMs)在训练过程中习得复杂能力的机制仍是机械可解释性中的一个关键开放问题。本项目研究是否可以通过复杂网络理论(CNT)的视角来刻画这些学习动力学。我提出了一种新方法,将基于Transformer的LLM表示为有向加权图,其中节点为模型的计算组件(注意力头和MLP),边表示通过基于干预的消融技术测量的因果影响。通过追踪Pythia-14M模型在经典归纳任务上143个训练检查点中该组件图的演化,我分析了一系列图论指标。结果表明,网络结构经历了探索、巩固和精炼的 distinct 阶段。具体而言,我识别出了信息传播组件稳定层级的出现以及信息收集组件动态集合的形成,它们在关键学习节点处重新配置其角色。这项工作证明了组件级网络视角为可视化和理解驱动LLM中功能电路形成的自组织原则提供了一个强大的宏观透镜。
引用
@article{arxiv.2509.15269,
title = {Modeling Transformers as complex networks to analyze learning dynamics},
author = {Elisabetta Rocchetti},
journal= {arXiv preprint arXiv:2509.15269},
year = {2025}
}