中文

平衡专业性与通用性:缓解大型语言模型灾难性遗忘的从粗到细框架

计算与语言 2025-02-25 v6

摘要

对齐的大型语言模型(LLMs)展现出显著的通用性,能够处理各种现实世界任务。同时,对齐的LLMs也被期望具有专业性,在特定应用中表现出色。然而,使用额外数据进行微调(获得专业性的常见做法)通常会导致先前获得的通用性灾难性遗忘(CF),从而阻碍模型在不同任务上的性能。针对这一挑战,我们提出了CoFiTune,一个从粗到细的框架,旨在平衡专业性和通用性。在粗粒度层面,利用经验树搜索算法定位并更新对专业性至关重要的特定模块,同时保持其他参数冻结;在细粒度层面,软掩码机制调节对LLMs的更新,在不损害专业性的情况下缓解CF问题。在对专业性和通用性的全面评估中,CoFiTune在不同任务和模型规模上始终优于基线方法。与全参数SFT相比,CoFiTune在13B模型上带来了约14%的通用性提升和轻微的专业性损失。最后,基于进一步分析,我们提供了关于LLMs中信息转发过程的推测性见解,这有助于解释所提出方法的有效性。代码可在https://github.com/rattlesnakey/CoFiTune获取。

关键词

引用

@article{arxiv.2404.10306,
  title  = {Balancing Speciality and Versatility: A Coarse to Fine Framework for Mitigating Catastrophic Forgetting in Large Language Models},
  author = {Hengyuan Zhang and Yanru Wu and Dawei Li and Sak Yang and Rui Zhao and Yong Jiang and Fei Tan},
  journal= {arXiv preprint arXiv:2404.10306},
  year   = {2025}
}

备注

43 pages, 10 figures, accepted by ACL 2024