中文

面向大规模模型仓库的语言模型即服务的黑盒模型合并

人工智能 2025-09-17 v1

摘要

模型合并是指将多个不同模型整合为一个统一模型的过程,该统一模型保留并融合了各个模型的优势与能力。现有方法大多依赖任务向量来组合模型,通常假设模型参数可访问。然而,对于像GPT-4这样通常仅通过API接口以黑盒服务形式提供的大规模语言模型(LLM)(即语言模型即服务),终端用户无法获取模型权重。这带来了一个重大挑战,我们称之为大规模LLM的黑盒模型合并(Black-box Model Merging, BMM)。为应对这一挑战,我们提出了一种基于进化算法(Evo-Merging)的无导数优化框架,该框架仅通过推理时的API查询即可实现有效的模型合并。我们的方法包含两个关键组成部分:(1)基于稀疏性的去噪,旨在识别并过滤掉模型间无关或冗余的信息;(2)符号感知缩放,根据模型性能动态计算相关模型的最优组合权重。我们还为非对称稀疏化提供了形式化证明和理论分析。广泛的实验评估表明,我们的方法在一系列任务上取得了最先进的结果,显著优于现有的强基线方法。

关键词

引用

@article{arxiv.2509.12951,
  title  = {Black-box Model Merging for Language-Model-as-a-Service with Massive Model Repositories},
  author = {Shilian Chen and Jie Zhou and Tianyu Huai and Yujiang Lu and Junsong Li and Bihao Zhan and Qianjun Pan and Yutao Yang and Xin Li and Qin Chen and Hang Yan and Liang He},
  journal= {arXiv preprint arXiv:2509.12951},
  year   = {2025}
}