中文

几何冲突:解释与控制 LLM 持续后训练中的遗忘

机器学习 2026-05-12 v1 信息论 math.IT

摘要

持续后训练旨在用新知识、技能和行为扩展大型语言模型(LLMs),但尚不清楚何时序列更新能实现能力迁移,何时会导致灾难性遗忘。现有方法通过序列微调、重放、正则化或模型合并来缓解遗忘,但对于确定何时引入新更新是有益或有害的标准有限。在本工作中,我们通过三个问题研究 LLM 持续后训练:是什么驱动了遗忘?顺序获得的能力何时迁移或干扰?如何利用兼容性来控制更新整合?我们通过任务几何来解决这些问题:我们用参数更新表示每个后训练任务,并研究由更新诱导的协方差几何。我们的核心发现是:遗忘可被视为一种状态相对的更新整合失败,当任务诱导的协方差几何与演化模型状态的几何失配时产生。当序列更新与先前更新塑造的模型状态保持兼容时发生迁移,当状态相对几何冲突变高时发生干扰。受此发现启发,我们提出了几何冲突 Wasserstein 合并(GCWM),这是一种无数据更新整合方法,通过 Gaussian Wasserstein 重心构建共享 Wasserstein 度量,并利用几何冲突来门控几何感知校正。在领域持续和能力持续设置下对 Qwen3 0.6B--14B 的实验中,GCWM 始终优于无数据基线,在没有重放数据的情况下提高了保留率和最终性能。这些结果将几何冲突确定为遗忘的解释性信号和 LLM 持续后训练的实用控制信号。

关键词

引用

@article{arxiv.2605.09608,
  title  = {Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-Training},
  author = {Yuanyi Wang and Yifan Yang and Su Lu and Yanggan Gu and Pengkai Wang and Wenjun Wang and Zhaoyi Yan and Congkai Xie and Jianmin Wu and Jialun Cao and Shing-Chi Cheung and Hongxia Yang},
  journal= {arXiv preprint arXiv:2605.09608},
  year   = {2026}
}