中文

泛化脊:自然语言生成中的信息流

计算与语言 2026-04-07 v5

摘要

基于 Transformer 的语言模型在自然语言生成 (NLG) 中取得了 SOTA 性能,但其合成任务相关信息的内部机制仍不够充分了解。虽然先前的研究表明,中间层通常比最终层产生更具泛化性的表示,但这种泛化能力在训练期间如何产生并在各层之间传播仍不清楚。我们提出了 InfoRidge,一个信息论框架,用于表征预测信息——隐藏表示与目标输出之间的互信息——在训练期间如何随深度变化。我们在各种模型和数据集上的实验揭示了一致的非单调趋势:预测信息在中间层达到峰值——形成泛化脊——然后在最终层下降,反映了泛化和记忆化之间的转变。为了进一步研究这一现象,我们进行了一组互补分析,利用残差缩放和注意力模式来表征层级功能特化。我们进一步通过多 token 生成实验验证了我们的发现,证实观察到的脊现象在解码步骤中持续存在。这些发现为 Transformer 的内部机制提供了新见解,并强调了中间层在支持泛化方面的关键作用。

关键词

引用

@article{arxiv.2507.05387,
  title  = {The Generalization Ridge: Information Flow in Natural Language Generation},
  author = {Ruidi Chang and Chunyuan Deng and Hanjie Chen},
  journal= {arXiv preprint arXiv:2507.05387},
  year   = {2026}
}