山巖之顶:通过动态逻辑融合实现弱到强的无需微调
计算与语言
2024-10-15 v2 人工智能
机器学习
摘要
高效微调大型语言模型以满足特定应用需求至关重要,然而这些模型参数庞大,使得训练日益具有挑战性。尽管提出了众多有效方法,但在更新期间仍存在大量内存开销用于梯度计算。 thm{我们能否对一系列任务特定小模型进行微调,并直接将其知识传递到一个更大模型而无需额外训练?}本文通过逻辑算术探索了弱到强的专业化,为该问题提供了直接答案。现有的弱到强方法常采用静态知识转移比率和单个小模型进行复杂知识传递,导致性能次优。为克服这些限制,我们提出了一种动态逻辑融合方法,可与一系列任务特定小模型配合使用,每个模型都在不同任务上专业化。在每个解码步骤中,该方法通过Kullback-Leibler发散受约束的优化问题学习这些模型之间的权重,以适应性地分配权重。我们在单任务和多任务设置中进行了广泛实验,取得了领先的结果。通过将7B模型的专长传递到13B模型,我们的方法在单任务场景中缩小了与13B模型完全微调之间的性能差距96.4%,在多任务场景中缩小86.3%。值得注意的是,我们实现了在未见任务上的超越性能。此外,我们进一步展示了该方法可以轻松集成单任务情境学习和多任务场景下的任务算术。
引用
@article{arxiv.2406.15480,
title = {On Giant's Shoulders: Effortless Weak to Strong by Dynamic Logits Fusion},
author = {Chenghao Fan and Zhenyi Lu and Wei Wei and Jie Tian and Xiaoye Qu and Dangyang Chen and Yu Cheng},
journal= {arXiv preprint arXiv:2406.15480},
year = {2024}
}
备注
Accepted by NeurIPS 2024