后训练中的遗忘量化刻画
机器学习
2026-03-13 v1 人工智能
统计理论
机器学习
统计理论
摘要
生成模型的持续后训练广泛使用,但对遗忘何时何地发生的原则性理解仍有限。我们在两种模式混合抽象下(表示旧任务和新任务),由 Chen 等人(2025,arXiv:2510.18874)提出,并在两种形式下 formalize 遗忘:(i)质量遗忘,即旧混合权重归零;(ii)旧组件漂移,即在训练期间已正确的旧组件发生位移。在等协方差高斯模式下,我们证明基于数据来自新分布的 forward-KL 目标会驱动旧权重归零,而 reverse-KL 目标收敛至真实目标(从而避免质量遗忘),并通过由巴哈拉契系数控制的重叠门控误分配概率仅微扰旧均值,导致随模式分离而指数衰减的漂移,以及具有指数收敛性的局部良好条件几何。我们进一步量化了重放与这些目标的相互作用。对于 forward-KL,重放必须修改训练分布以改变 population optimum;对于 reverse-KL,重放不改变 population 目标,但通过受限重要加权防止有限批量旧模式饥饿。最后,我们通过相同视角分析近期提出的三种近似 on-policy 后训练方法:SDFT(arxiv:2601.19897)、TTT-Discover(arxiv:2601.16175)和 OAPL(arxiv:2602.19362),并推导出每种方法保留旧质量并 exhibits 由重叠控制的漂移的显式条件。总体而言,我们的结果表明,遗忘可基于 divergence 方向、几何行为重叠、抽样 regime 以及训练期间过去行为可见性进行精确量化。
引用
@article{arxiv.2603.12163,
title = {A Quantitative Characterization of Forgetting in Post-Training},
author = {Krishnakumar Balasubramanian and Shiva Prasad Kasiviswanathan},
journal= {arXiv preprint arXiv:2603.12163},
year = {2026}
}