中文

无上下文合成数据缓解遗忘

机器学习 2026-02-03 v2

摘要

微调语言模型通常会导致其在其他任务上的现有性能下降,这是由于模型参数的变化引起的;这一现象通常被称为(灾难性)遗忘。我们感兴趣的是在仅能访问模型权重但无法访问其训练数据/训练方案的情况下缓解这一问题。一种自然的方法是惩罚原始模型与新模型之间的 KL 散度。我们的主要发现是,一个简单的过程——我们称之为无上下文生成——允许对该 KL 散度进行近似无偏估计。我们表明,通过无上下文生成增强微调数据集可以缓解遗忘,在两种设置中:(a) 保持仅预训练模型的零样本性能,(b) 保持思维模型的推理性能。我们表明,上下文合成数据,甚至预训练数据的一部分,效果较差。我们还研究了生成温度、数据比例等因素的影响。我们在仅预训练设置中为 OLMo-1B 呈现结果,在推理设置中为 R1-Distill-Llama-8B 呈现结果。

关键词

引用

@article{arxiv.2505.13811,
  title  = {Context-Free Synthetic Data Mitigates Forgetting},
  author = {Parikshit Bansal and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2505.13811},
  year   = {2026}
}