中文

稀疏语义维度:大语言模型的泛化证书

机器学习 2026-02-13 v1 计算与语言

摘要

标准统计学习理论预测,大型语言模型(LLM)应因参数数量远超过训练标记数而出现过拟合。然而,实际中它们能够实现稳健的泛化。我们提出,控制泛化的有效容量存在于模型内部表示的几何结构中:虽然参数空间是高维的,但激活状态位于低维稀疏流形上。为形式化这一观点,我们引入稀疏语义维度(SSD),这是从稀疏自编码器(SAE)在模型各层中活跃特征词汇中派生的复杂度度量。将LLM和SAE视为冻结或acles,我们利用这一框架将模型的泛化能力归因于字典稀疏性,而非总体参数数量。经验上,我们在GPT-2 Small和Gemma-2B上验证了这一框架,证明我们的界限在真实样本规模下提供了非空洞的证书。关键在于,我们发现一种反直觉的“特征锐度”扩展规律:尽管Gemma-2B参数量大了一个数量级,但其识别活跃流形所需的校准样本显著少于GPT-2,这表明更大的模型学习了更可压缩、更独特的语义结构。最后,我们展示该框架可作为可靠的安全监控器:分布外输入会触发可测量的“特征爆炸”(活跃特征的尖锐峰值),通过学习到的特征违规有效地信号化了贝叶斯不确定性。代码地址:https://github.com/newcodevelop/sparse-semantic-dimension

关键词

引用

@article{arxiv.2602.11388,
  title  = {Sparse Semantic Dimension as a Generalization Certificate for LLMs},
  author = {Dibyanayan Bandyopadhyay and Asif Ekbal},
  journal= {arXiv preprint arXiv:2602.11388},
  year   = {2026}
}

备注

Work in progress (17 pages)