中文

AP-BMM:通过异步先验引导的贝叶斯模型合并近似 LLM 的能力-成本帕累托集

机器学习 2026-05-14 v6 计算与语言 神经与进化计算

摘要

服务大型语言模型(LLM)通常需要在更强的推理能力和较低的推理成本之间做出选择。模型合并提供了一种实用的方法来构建介于推理导向模型和更便宜的基础模型之间的多个模型,但常见的模型级合并方法通常仅使用一到两个全局参数来控制这种权衡。我们将这一设定研究为多目标优化问题:目标不是生成一个合并模型,而是找到一组覆盖不同准确率-令牌成本偏好的合并模型。逐层合并更加灵活,因为它可以为不同的 Transformer 层分配不同的合并权重。然而,它引入了两个实际挑战。首先,逐层搜索空间很大,现有方法通常在搜索时不利用源模型中的有用信号。其次,LLM 评估可能需要非常不同的时间,因此同步批量优化在等待慢速评估时会浪费 GPU 时间。我们提出了异步先验引导的贝叶斯模型合并(AP-BMM)。AP-BMM 利用源模型之间的参数和推理激活差异来建议在搜索早期哪些层应该重要。它还使用一个异步贝叶斯优化循环,考虑已经正在评估的候选模型。一个轻量级的重排序步骤进一步在准确率-成本权衡中分散候选模型。在固定的评估预算下,AP-BMM 在帕累托集质量和更广泛的权衡覆盖方面优于同步逐层基线和代表性模型级合并基线。与同步贝叶斯基线相比,它还通过提高 GPU 利用率减少了挂钟时间。代码:https://github.com/MiLab-HITSZ/AP-BMM。

关键词

引用

@article{arxiv.2512.09972,
  title  = {AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging},
  author = {Kesheng Chen and Yamin Hu and Zhenqian Zhu and Yiya Diao and Wenjian Luo},
  journal= {arXiv preprint arXiv:2512.09972},
  year   = {2026}
}