通过实践保持记忆:在策略学习中数据的作用在缓解遗忘方面的作用
机器学习
2025-12-04 v2 计算与语言
摘要
通过后训练适应语言模型(LM)以处理新任务会带来风险,即现有能力的退化——这被称为灾难性遗忘。本文旨在识别缓解这一现象的指南,系统比较了两种广泛采用的后训练方法:监督微调(SFT)和强化学习(RL)。我们的实验结果显示,在不同的 LM 家族(Llama、Qwen)和任务(指令遵循、常识推理、算术推理)中,RL 比 SFT 更少地发生遗忘,同时在实现目标任务性能方面相当或更好。为探讨这种差异的原因,我们考虑了一个简化设置,将 LM 模型为两个分布的混合物,一个对应先前知识,另一个对应目标任务。我们识别出,RL 的模式寻求性质——这源于其使用在策略数据——使得在学习目标任务时保持先前知识完整。我们随后通过演示在实际场景中使用近似在策略数据,来验证了这一洞见,说明这是 RL 对遗忘鲁棒性的根本原因,而非 KL 正则化或收益估计等其他算法选择。最后,作为实际意义,我们的结果突显了使用约为在策略数据来缓解遗忘的潜力,这些数据比完全在策略数据更高效地获取。
引用
@article{arxiv.2510.18874,
title = {Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting},
author = {Howard Chen and Noam Razin and Karthik Narasimhan and Danqi Chen},
journal= {arXiv preprint arXiv:2510.18874},
year = {2025}
}