中文

AIMMerging:基于训练轨迹的自适应迭代模型合并用于语言模型持续学习

计算与语言 2025-09-23 v1 人工智能

摘要

持续学习(CL)对于在无需昂贵重新训练的情况下将大型语言模型(LLM)部署到动态真实世界环境中至关重要。最近的模型合并方法引起了广泛关注,但仍然难以有效管理在学习新知识与防止遗忘之间的权衡,这一挑战主要源于次优的合并次数和合并频率。在本文中,我们引入了自适应迭代模型合并(AimMerging),这是一种新的CL框架,利用学习和遗忘信号从训练轨迹动态监控模型的训练状态。根据动态监控,训练轨迹引导的合并控制器自适应地确定迭代融合的时机和频率,而再现基于的知识融合模块计算合并权重并执行融合。在三个CL基准上的全面实验中显示,AIMMerging在各种模型大小(从770M到13B)上的性能显著优于现有最先进的方法,在FWT和BWT上分别实现了约80%和59%的平均相对提升。提供源代码以便重复验证。

关键词

引用

@article{arxiv.2509.17348,
  title  = {AIMMerging: Adaptive Iterative Model Merging Using Training Trajectories for Language Model Continual Learning},
  author = {Yujie Feng and Jian Li and Xiaoyu Dong and Pengfei Xu and Xiaohui Zhou and Yujia Zhang and Zexin LU and Yasha Wang and Alan Zhao and Xu Chu and Xiao-Ming Wu},
  journal= {arXiv preprint arXiv:2509.17348},
  year   = {2025}
}

备注

EMNLP 2025