中文

收敛间隙:指令微调语言模型在前向传递中稳定性较晚

机器学习 2026-05-11 v1

摘要

最终输出隐藏了检查点何时提交其下一个标记预测的时刻。我们引入收敛间隙,这是一种模型差异诊断工具,用于解码每个层的下一个标记分布,并衡量其与模型最终分布之间的距离。在六对预训练和指令微调检查点在原生提示 regime 下进行测试后,指令微调检查点在堆栈较深的地方仍远离其最终预测。该效应在端点匹配的原始和微调读出、端点自由的相同历史检查以及固定历史模板回放下仍然存在。匹配的前缀干预识别出晚期MLP窗口为最大的测试杠杆点:晚期IT嵌入到PT主机上会使晚期KL增加+0.34 nats,而PT在IT主机上进行晚期交换会使其减少-0.51 nats;匹配的随机晚期扰动仅为+0.003,而真实晚期嵌入为+0.327。Gemma案例研究为相同晚期交换提供了面向行为的可信度,尽管其并非基准论题。这一结果识别了后训练的鲁棒预测动力学特征:发布的指令遵循检查点倾向于稍后稳定,晚期MLP计算是最强测试的双向杠杆,针对匹配历史。

关键词

引用

@article{arxiv.2605.07282,
  title  = {The Convergence Gap: Instruction-Tuned Language Models Stabilize Later in the Forward Pass},
  author = {Yifan Zhou},
  journal= {arXiv preprint arXiv:2605.07282},
  year   = {2026}
}