中文

面向医学大语言模型的高效模型合并的新型分层集成方法

机器学习 2025-11-18 v1 人工智能

摘要

大型语言模型 (LLM) 在分布式医疗环境中面临诸多挑战,包括在保持隐私的前提下整合跨机构的专业领域知识、减少计算开销以及在模型更新过程中防止灾难性遗忘。本文系统评估了六种参数空间合并技术应用于两个源自 Mistral-7B 基础模型的架构兼容医学大语言模型。我们引入一种新颖的分层方法,结合注意力层的选择性最优传输 (Optimal Transport, OT) 对齐与余弦相似度加权插值,以解决置换方差问题,同时最小化面向边缘部署场景的计算开销。我们的研究在五个医学基准测试中评估了任务算术 (Task Arithmetic)、线性平均、DARE-TIES、DELLA、Breadcrumbs 以及我们的分层方法。结果表明,架构兼容的模型从简单平均方法中获益显著,任务算术在 MedQA 上取得 45.80% 的准确率,超过了复杂的剪枝-based 方法。这些发现为在资源受限的物联网环境中部署分布式医疗 AI 提供了关键见解,此处计算效率和模型兼容性至关重要。我们的工作表明,对于架构兼容的模型,简单平均提供了一种稳健且计算高效的知识整合基线,为可扩展的医疗 AI 系统提供了务实的路径。

关键词

引用

@article{arxiv.2511.13373,
  title  = {A Novel Hierarchical Integration Method for Efficient Model Merging in Medical LLMs},
  author = {Prakrit Timilsina and Anuj Nepal and Rajan Kadel and Robin Doss},
  journal= {arXiv preprint arXiv:2511.13373},
  year   = {2025}
}