大二元模型:变换器语言模型中的下一个标记映射
计算与语言
2025-12-04 v3
摘要
在变换器语言模型中,激活向量从当前token嵌入转化为下一个token预测,随着模型的深入而发生变化。为隔离这种转换的最小形式,我们识别出进行二元预测的子网络,这些子网络基于当前token进行朴素的下一个token预测。我们发现,二元子网络可在最高达10亿参数的完全训练语言模型中找到,这些子网络即使仅构成模型参数的0.2%,也是模型性能的关键。二元子网络集中在变换器MLP层的第一层,与为给定模型进行最优剪枝的子网络重叠显著。机制上,二元子网络常常从完整模型中复制模式,其中第一层诱导激活与下一个token预测相匹配,而非当前token表示。我们的结果表明,二元子网络是语言模型中用于基本下一个token预测的最小参数子集,既是必要的又是充分的,并且有助于驱动从当前到下一个token激活在残差流中的转换。这些子网络可以为通过从最小电路构建来研究更复杂的语言模型电路提供基础。
引用
@article{arxiv.2504.15471,
title = {Bigram Subnetworks: Mapping to Next Tokens in Transformer Language Models},
author = {Tyler A. Chang and Benjamin K. Bergen},
journal= {arXiv preprint arXiv:2504.15471},
year = {2025}
}
备注
NeurIPS 2025