FuseRL:异构模型融合的稠密偏好优化
计算与语言
2025-04-18 v2
摘要
异构模型融合通过整合多个结构多样模型的知识与能力来提升 LLM 的性能。然而,现有方法常仅依赖从源模型中为每个提示选择最佳输出,导致未充分利用模型潜力,因而产生稀疏优化信号。为此,我们提出了 FuseRL 框架,包括 FuseSFT 和 FusePO 两个阶段,以最大化源 LLM 的利用率。FuseSFT 通过对每个提示的多样化输出进行加权监督微调(SFT)来建立稳健的初始化。FusePO 根据多个源模型的输出优化加权偏好,以实现更佳的对齐性能。大量实验表明,我们的框架在各种偏好对齐方法中(包括 RLOO、DPO 和 SimPO)均有效。以 Llama-3.1-8B-Instruct 为目标模型,我们的方法在 AlpacaEval-2 和 Arena-Hard 基准测试中实现了 8B 规模 LLM 中的最佳性能。进一步分析表明,FuseSFT 正规化训练过程以减少过拟合,而 FusePO 引入稠密且多样化的偏好优化信号。
引用
@article{arxiv.2504.06562,
title = {FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion},
author = {Longguang Zhong and Fanqi Wan and Ziyi Yang and Guosheng Liang and Tianyuan Shi and Xiaojun Quan},
journal= {arXiv preprint arXiv:2504.06562},
year = {2025}
}