中文

大型语言模型的原子化

计算与语言 2026-02-02 v2 人工智能

摘要

大型语言模型(LLM)的基本表征单元(FRUs)尚未定义,这限制了对其底层机制的进一步理解。本文引入原子理论(Atom Theory),系统定义、评估并识别此类FRUs,称为原子。基于原子内积(AIP)——一种捕捉LLM表征底层几何的非欧几里得度量——我们正式定义原子,并提出两种关键标准以衡量理想原子:忠实度(R2R^2)与稳定性(qq^*)。我们进一步证明,在阈值激活稀疏自编码器(TSAEs)下,原子是可被识别的。经验上,我们发现LLM中普遍存在表征迁移现象,AIP纠正了此迁移以捕捉底层表征几何,从而使原子理论得以奠基。我们发现,两种常用单元——神经元与特征——均不符合理想原子的标准:神经元忠实度为1但稳定性仅为0.5%,而特征稳定性更高(q=68.2%q^*=68.2\%)但忠实度较低(R2=48.8%R^2=48.8\%)。为识别LLM的原子,基于TSAEs下的可识别性,我们通过大规模实验表明,仅当TSAE容量匹配数据规模时,才可实现可靠的原子识别。借助此洞见,我们在Gemma2-2B、Gemma2-9B和Llama3.1-8B各层识别出FRUs,忠实度接近完美(R2=99.9%R^2=99.9\%),稳定性达99.8%,满足理想原子的统计学标准。进一步分析确认,这些原子与理论预期相符且单语性显著提升。总体而言,我们提出并验证了原子理论作为理解LLM内部表征基础。代码已公开于https://github.com/ChenhuiHu/towards_atoms。

关键词

引用

@article{arxiv.2509.20784,
  title  = {Towards Atoms of Large Language Models},
  author = {Chenhui Hu and Pengfei Cao and Yubo Chen and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2509.20784},
  year   = {2026}
}