在线性表示假设下,语言模型可以存储多少特征?
机器学习
2026-02-13 v1 人工智能
计算与语言
信息论
组合数学
math.IT
摘要
我们引入了一个用于线性表示假设(LRH)的数学框架,后者断言语言模型的中间层以线性方式存储特征。我们将该假设分为两个声明:线性表示(特征在神经元激活中以线性方式嵌入)和线性可访问性(特征可以以线性方式解码)。随后我们提出问题:多少神经元d足以同时线性表示和线性访问m个特征?经典的压缩感知结果表明,对于k稀疏输入,当允许非线性解码算法时,d = O(k log(m/k)) 足以满足需求(Candes和Tao, 2006; Candes等, 2006; Donoho, 2006)。然而,额外的线性解码要求将问题从经典压缩感知转向线性压缩感知。我们的主要理论结果为线性压缩感知建立近乎匹配的上、下界。我们证明需要 d = Ω_ε((k²/log k) log(m/k)),而 d = O_ε(k² log m) 足以实现。下界在定量上建立了经典与线性压缩设置之间的差距,说明线性可访问性是比仅线性表示更强的假设。上界确认了在LRH下,神经元可以存储指数级数量的特征,为“超位置假设”(Elhage等, 2022)提供了理论依据。上界证明使用标准的随机矩阵构造(具有近似正交列),下界证明使用近单位矩阵的秩界(Alon, 2003)和图的极理论(限制无环图的边数)。我们还展示了我们的结果如何约束和不约束特征表示的几何,并扩展我们的结果以允许带有激活函数和偏置的解码器。
引用
@article{arxiv.2602.11246,
title = {How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?},
author = {Nikhil Garg and Jon Kleinberg and Kenny Peng},
journal= {arXiv preprint arXiv:2602.11246},
year = {2026}
}