基于 Softmax 熵累积展开探测下一个词预测的几何结构
计算与语言
2025-10-07 v1 统计力学
机器学习
机器学习
摘要
我们提出了一种基于累积展开框架,用于量化大语言模型(LLM)在下一个词预测中内化更高阶统计结构的方式。通过将每个层的 logit 分布的 softmax 熵视为其“中心”分布的扰动,我们推导出闭式的累积可观测量,以分离 successively 更高阶的相关性。经验上,我们在 Pile-10K 提示上跟踪 GPT-2 和 Pythia 模型的累积量。(i)结构化提示在各层呈现特有的上升-平台轮廓,而标记随机化后的提示保持平稳,这揭示了累积轮廓对有意义上下文的依赖。(ii)在训练期间,所有累积量在饱和之前单调递增,直接可视化模型从捕捉方差到学习偏度、峰度以及更高阶统计结构的过程。(iii)数学提示显示与通用文本不同的累积信号,量化了模型在处理数学与语言内容时采用的根本不同处理机制。总体而言,这些结果建立了累积分析作为高维神经网络特征学习动力学的轻量级、数学基础探针。
引用
@article{arxiv.2510.04285,
title = {Probing Geometry of Next Token Prediction Using Cumulant Expansion of the Softmax Entropy},
author = {Karthik Viswanathan and Sang Eon Park},
journal= {arXiv preprint arXiv:2510.04285},
year = {2025}
}
备注
14 pages, 7 figures. Poster at HiLD 2025: 3rd Workshop on High-dimensional Learning Dynamics