中文

MetaGDPO:通过群体直接偏好优化利用元认知知识缓解灾难性遗忘

人工智能 2025-11-18 v1

摘要

大型语言模型展现出强大的推理能力,这些能力可以有效压缩到较小的模型中。然而,现有数据集和微调方法仍面临挑战,导致灾难性遗忘,尤其是针对8B参数以下的模型。首先,大多数数据集通常忽略训练数据知识与模型内在能力之间的关系,这使得保存先前知识难度加大。其次,常规训练目标往往无法约束内在知识的保存,可能导致对先前学习技能的遗忘。为解决这些问题,我们提出了从数据和微调方法两个角度综合性解决方案,以缓解灾难性遗忘。在数据层面,我们构建了包含5000个实例的数据集,覆盖多个推理任务,并融入元认知知识,使其对压缩到较小模型具有更高的容忍度和有效性。我们为解决每个问题所需的元认知知识进行标注,并根据任务知识和模型内在技能对数据进行筛选。在训练层面,我们引入了GDPO(群体方向偏好优化),该方法更适用于资源受限的场景,能够高效近似GRPO的性能。通过大型模型引导,并通过参考模型隐式约束优化路径,GDPO实现了更有效的知识从大型模型到小型模型的传递,并约束了参数的过度漂移。广泛的实验表明,我们的方法显著缓解了灾难性遗忘,并在较小模型上提高了推理性能。

关键词

引用

@article{arxiv.2511.12113,
  title  = {MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization},
  author = {Lanxue Zhang and Yuqiang Xie and Fang Fang and Fanglong Dong and Rui Liu and Yanan Cao},
  journal= {arXiv preprint arXiv:2511.12113},
  year   = {2025}
}

备注

23 pages, 10 figures, AAAI 2026