中文

一次微调:通过动态增强退火解耦通用与领域学习

计算与语言 2025-10-20 v2 人工智能 机器学习

摘要

大型语言模型(LLM)的微调展现出卓越的潜力。然而,普通的微调方法通常需要复杂的数据混合和重复实验才能实现最优泛化。为了应对这些挑战并简化训练流程,我们提出了一种高效且通用的解决方案——动态增强退火(DBA)。我们通过在通用数据上进行零学习率训练获得全局梯度,随后将其用于领域训练期间的梯度增强和动态训练步长校正。结合退火学习,我们最终建立了一个仅依赖领域数据而不会崩溃的微调流程。通过在多个流行基座模型上评估多个任务的通用和领域特定性能,DBA在联合性能上相比普通微调平均提升了5.8%。此外,由于通用数据不再参与退火过程,由数据混合导致的重复实验也被消除。根据我们的测试,与普通方法相比,DBA方法可减少91.0%的GPU小时数。

关键词

引用

@article{arxiv.2509.26242,
  title  = {Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing},
  author = {Yang Tang and Ruijie Liu and Yifan Wang and Shiyu Li and Xi Chen},
  journal= {arXiv preprint arXiv:2509.26242},
  year   = {2025}
}

备注

9 pages, 5 figures