基于最优传输的渐进式深度扩展
计算与语言
2025-08-12 v1
摘要
扩展大语言模型 (LLMs) 能带来性能提升,但会产生巨大的训练成本。深度扩展通过向预训练模型添加新层来提高训练效率。然而,大多数现有方法从基础层复制或平均权重,忽略了神经元排列的差异。这一局限性可能导致错位,从而损害性能。受应用最优传输 (OT) 进行神经元对齐的启发,我们提出了最优传输深度扩展 (OpT-DeUS)。OpT-DeUS 通过 OT 对齐并融合相邻基础层中的 Transformer 块来创建新层,以减轻层间神经元排列不匹配的问题。与现有方法相比,OpT-DeUS 在不同模型规模的持续预训练和监督微调中实现了更好的整体性能,并提供了更高的训练效率。为了进一步评估插值位置的影响,我们广泛的分析表明,将新层插入到更靠近顶部的位置,由于反向传播时间更短,可获得更高的训练效率,同时获得额外的性能增益。
引用
@article{arxiv.2508.08011,
title = {Progressive Depth Up-scaling via Optimal Transport},
author = {Mingzi Cao and Xi Wang and Nikolaos Aletras},
journal= {arXiv preprint arXiv:2508.08011},
year = {2025}
}