中文

梯度必须赢得其影响力:用广义熵目标统一监督微调

计算与语言 2026-02-13 v1 人工智能 机器学习

摘要

标准监督微调(SFT)的负对数似然(NLL)采用统一的词元级加权。这种刚性造成了双重失效模式:(i) 过度强调低概率目标会放大噪声监督上的梯度并破坏稳健先验,(ii) 当模型已经自信时,统一加权提供的锐化效果较弱。现有方法未能解决由此产生的可塑性-稳定性困境,常常在抑制有害学习信号的同时也抑制了必要的学习信号。为了解决这个问题,我们将词元级SFT目标统一在一个广义变形对数族中,并揭示了一个通用的门控×\times误差梯度结构,其中门控控制模型对其当前预测的信任程度。通过采用Cayley变换,我们将模型不断演化的不确定性映射到一个连续的焦点轨迹上,从而实现了在涉及不确定的新概念和涉及成熟知识的场景之间的无缝插值。然后,我们引入了动态熵微调(DEFT),这是一种无参数的目标函数,它使用分布集中度(Rényi-2熵)作为模型预测状态的一个实用代理来调节信任门控。大量的实验和分析表明,DEFT在探索和利用之间实现了更好的平衡,从而提高了整体性能。

关键词

引用

@article{arxiv.2602.11424,
  title  = {Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives},
  author = {Zecheng Wang and Deyuan Liu and Chunshan Li and Yupeng Zhang and Zhengyun Zhao and Dianhui Chu and Bingning Wang and Dianbo Sui},
  journal= {arXiv preprint arXiv:2602.11424},
  year   = {2026}
}