中文

通过混合训练缓解数学推理微调中的灾难性遗忘

机器学习 2025-12-17 v1 计算与语言

摘要

在为数学推理等专业任务微调大语言模型时,模型会表现出灾难性遗忘,丧失先前学习的能力。我们通过在 DeepMind Mathematics 数据集上微调 Flan-T5-Base(250M 参数)并在 MultiNLI 上测量遗忘来研究这一现象。仅使用数学数据训练将数学准确率从 3.1% 提升至 12.0%,但导致 NLI 准确率从 81.0% 暴跌至 16.5%——64.5 个百分点的下降在前 1,000 个训练步内发生。我们提出了在训练过程中交替混合数学和 NLI 样本的混合训练策略。结果表明,混合训练在保持同等数学性能的同时完全消除了灾难性遗忘:1:1 的平衡比例实现了 12.0% 的数学准确率(与仅使用数学训练持平),同时保留了 86.2% 的 NLI 准确率。我们系统地探索了从 1:1 到 15:1 的混合比例,发现即使是最少的 NLI 暴露(6.2%)也能提供有效的正则化。这些发现表明,专业化不需要以遗忘通用能力为代价,这对扩展到更大模型具有启示意义,因为混合训练在防止遗忘之外可能带来额外的收益。

关键词

引用

@article{arxiv.2512.13706,
  title  = {Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training},
  author = {John Graham Reynolds},
  journal= {arXiv preprint arXiv:2512.13706},
  year   = {2025}
}

备注

11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning