中文

推理稳定点:用于稳定证据与捷径依赖的训练时信号

人工智能 2026-01-21 v1 机器学习

摘要

微调预训练语言模型可以提高任务性能,同时也会微妙地改变模型所依赖的证据。我们提出了一种训练时可解释性视角,跟踪微调周期中的 token 级归因。我们将解释漂移定义为在固定探针集上归一化 token 归因随周期的变化,并引入推理稳定点(RSP),即漂移保持持续低位的最早周期。RSP 根据运行内漂移动态计算得出,无需在分布外数据上进行调优。在多个轻量级 Transformer 分类器和基准分类任务中,漂移通常在训练早期就降至低且稳定的机制,而验证准确率仅发生微小变化。在带有标签相关触发 token 的受控捷径设置中,归因动态揭示了即使验证准确率保持竞争力,模型对捷径的依赖仍在增加。总体而言,解释漂移提供了一种简单、低成本的诊断方法,用于监控微调过程中决策证据的演变,并在稳定证据机制下选择检查点。

关键词

引用

@article{arxiv.2601.11625,
  title  = {Reasoning Stabilization Point: A Training-Time Signal for Stable Evidence and Shortcut Reliance},
  author = {Sahil Rajesh Dhayalkar},
  journal= {arXiv preprint arXiv:2601.11625},
  year   = {2026}
}

备注

8 pages, Submitted to ACL Rolling Review and is under review