ProFuser:大型语言模型的渐进式融合
计算与语言
2025-11-18 v2 人工智能
摘要
虽然通过融合各种大型语言模型的能力和优势可以构建出更强大和更灵活的模型,但一个根本性挑战在于在训练过程中正确地选择有优势的模型。现有的融合方法主要关注使用基于教师强制设置的交叉熵来衡量模型优势的训练模式,这可能对模型优势提供的见解有限。本文引入一种新方法,通过纳入训练和推理两种模式来增强融合过程。该方法不仅通过训练中的交叉熵来评估模型优势,还考虑推理输出,提供更全面的评估。为有效地结合这两种模式,我们引入 ProFuser 逐渐过渡从推理模式到训练模式。为验证 ProFuser 的有效性,我们融合了三个模型,包括 Vicuna-7B-v1.5、Llama-2-7B-Chat 和 MPT-7B-8K-Chat,展示了在知识、推理和安全性方面相较于基线方法取得了改进。
引用
@article{arxiv.2408.04998,
title = {ProFuser: Progressive Fusion of Large Language Models},
author = {Tianyuan Shi and Fanqi Wan and Canbin Huang and Xiaojun Quan and Chenliang Li and Ming Yan and Ji Zhang and Minhua Huang and Wu Kai},
journal= {arXiv preprint arXiv:2408.04998},
year = {2025}
}
备注
Accepted to AAAI 2026