中文

基于深度混合 ensembles 的语言模型调优

计算与语言 2024-10-18 v1 人工智能

摘要

基于Transformer的大语言模型(LLM)传统上依赖最终层损失进行训练和最终层表示进行预测,可能忽略中间层所蕴含的预测能力。我们惊讶地发现,专注于训练这些中间层可获得与最终层相当的训练损失,并在测试时表现出互补性。我们引入一种新颖的调优框架,即深度混合 ensembles(MoD),该框架将晚期层作为贡献于最终logits的ensembles,通过学习到的路由权重进行整合。通过辅助蒸馏损失和额外的归一化模块,我们确保晚期层的输出适应语言模型。我们的MoD框架可与任何现有调优方法集成,在各种语言建模任务中均显示出一致的改进。此外,通过用MoD取代传统可训练模块,我们的方法在显著减少可训练参数的同时实现了类似性能,展示了在训练期间利用中间表示预测能力的潜力。

关键词

引用

@article{arxiv.2410.13077,
  title  = {Tuning Language Models by Mixture-of-Depths Ensemble},
  author = {Haoyan Luo and Lucia Specia},
  journal= {arXiv preprint arXiv:2410.13077},
  year   = {2024}
}