中文

大规模持续指令助手

机器学习 2025-12-15 v5 人工智能 计算与语言

摘要

持续指令调优(CIT)用于通过数据持续指导大型模型遵循人类意图。观察到现有梯度更新在CIT过程中会严重破坏先前数据集的性能。相比之下,指数移动平均(EMA)能够追踪先前参数,有助于降低遗忘。然而,其稳定的平衡权重无法处理不断变化的数据集,导致塑性与稳定性之间失衡。本文提出一种通用持续指令调优框架以解决此挑战。基于塑性与稳定性的权衡前提及EMA更新,我们提出塑性与稳定性的理想条件。通过对损失函数进行泰勒展开,我们发现最佳平衡权重可由梯度和学习参数自动确定。因此,我们提出一种稳定-塑性平衡系数以避免知识干扰。基于指令的语义相似性,我们可以确定是重新训练还是扩展训练参数,并为测试实例分配最合适的参数。跨多个持续指令调优基准的广泛实验表明,我们的方法不仅提升了抗遗忘能力,还显著改进了整体持续调优性能。我们的代码已公开:https://github.com/JingyangQiao/CoIN。

关键词

引用

@article{arxiv.2410.10868,
  title  = {Large Continual Instruction Assistant},
  author = {Jingyang Qiao and Zhizhong Zhang and Xin Tan and Yanyun Qu and Shouhong Ding and Yuan Xie},
  journal= {arXiv preprint arXiv:2410.10868},
  year   = {2025}
}