下一词预测中的流形轨迹:从复制子动力学到Softmax平衡
机器学习
2025-09-01 v1 人工智能
动力系统
摘要
大型语言模型中的解码常被描述为对词标记计分并以softmax标准化。我们给出这一步骤作为概率单纯形上受约束的变分原理的最小、自包含论述。离散且尊重归一化的上升过程是经典的乘性权重(熵奇异镜像)更新;其连续时间极限是复制子流。基于这些要素,我们证明对于固定上下文和温度,下一个词分布沿着单纯形内的光滑轨迹收敛至softmax平衡。这正式化了常见的“单形遍历”直觉在输出分布层面的含义。该分析产生具体、可操作的后果:温度作为沿相同轨迹时间的精确比例尺缩放,而top-k和核采样则将流限制在具有相同保证的面上。我们还概述了路径相关得分调整的受控论述及其与类循环、幻觉式行为的联系。我们不对训练动力学或内部表示作出任何声称;这些 defers给未来工作。
引用
@article{arxiv.2508.21186,
title = {Manifold Trajectories in Next-Token Prediction: From Replicator Dynamics to Softmax Equilibrium},
author = {Christopher R. Lee-Jenkins},
journal= {arXiv preprint arXiv:2508.21186},
year = {2025}
}