大型语言模型的原子化
计算与语言
2026-02-02 v2 人工智能
摘要
大型语言模型(LLM)的基本表征单元(FRUs)尚未定义,这限制了对其底层机制的进一步理解。本文引入原子理论(Atom Theory),系统定义、评估并识别此类FRUs,称为原子。基于原子内积(AIP)——一种捕捉LLM表征底层几何的非欧几里得度量——我们正式定义原子,并提出两种关键标准以衡量理想原子:忠实度()与稳定性()。我们进一步证明,在阈值激活稀疏自编码器(TSAEs)下,原子是可被识别的。经验上,我们发现LLM中普遍存在表征迁移现象,AIP纠正了此迁移以捕捉底层表征几何,从而使原子理论得以奠基。我们发现,两种常用单元——神经元与特征——均不符合理想原子的标准:神经元忠实度为1但稳定性仅为0.5%,而特征稳定性更高()但忠实度较低()。为识别LLM的原子,基于TSAEs下的可识别性,我们通过大规模实验表明,仅当TSAE容量匹配数据规模时,才可实现可靠的原子识别。借助此洞见,我们在Gemma2-2B、Gemma2-9B和Llama3.1-8B各层识别出FRUs,忠实度接近完美(),稳定性达99.8%,满足理想原子的统计学标准。进一步分析确认,这些原子与理论预期相符且单语性显著提升。总体而言,我们提出并验证了原子理论作为理解LLM内部表征基础。代码已公开于https://github.com/ChenhuiHu/towards_atoms。
引用
@article{arxiv.2509.20784,
title = {Towards Atoms of Large Language Models},
author = {Chenhui Hu and Pengfei Cao and Yubo Chen and Kang Liu and Jun Zhao},
journal= {arXiv preprint arXiv:2509.20784},
year = {2026}
}