基于合成数据的临床小型语言模型模块化方法:预指令调优、模型合并与临床任务对齐
计算与语言
2025-08-27 v2 人工智能
摘要
大型语言模型如 GPT-4 的高计算成本和延迟限制了其在临床环境中的部署。小型语言模型(SLMs)提供了具有成本效益的替代方案,但其有限的容量需要生物医学领域适配,而这一适配仍然具有挑战性。另一个瓶颈是临床数据的获取困难和高度敏感。为应对这些挑战,我们提出了一种 novel 框架,用于将 SLMs 适配为高性能临床模型。我们引入了 MediPhi 3.8B 参数 SLMs 的集合,这一集合是通过我们 novel 框架开发的:对相关医学和临床语料(PMC、Medical Guideline、MedWiki 等)上的 expert 模型进行预指令调优、模型合并和临床任务对齐。为覆盖大多数临床任务,我们将 CLUE 基准扩展为 CLUE+,其规模翻倍。我们的 expert 模型在该基准上相对于 base 模型实现了相对改进,无需任何任务特定的微调:在医学实体上提升 64.3%,在放射学报告上提升 49.5%,在 ICD-10 编码上提升 44%(超越 GPT-4-0125 14%)。我们通过模型合并将 expert 模型统一整合到 MediPhi 中,保留了跨基准的收益。此外,我们构建了 MediFlow 集合,这是一个包含 250 万条高质量指令的合成数据集,覆盖 14 项医学 NLP 任务、98 种细粒度文档类型,并支持 JSON 格式。通过监督微调和直接偏好优化对 MediPhi 进行对齐,平均提升了 18.9%。
引用
@article{arxiv.2505.10717,
title = {A Modular Approach for Clinical SLMs Driven by Synthetic Data with Pre-Instruction Tuning, Model Merging, and Clinical-Tasks Alignment},
author = {Jean-Philippe Corbeil and Amin Dada and Jean-Michel Attendu and Asma Ben Abacha and Alessandro Sordoni and Lucas Caccia and François Beaulieu and Thomas Lin and Jens Kleesiek and Paul Vozila},
journal= {arXiv preprint arXiv:2505.10717},
year = {2025}
}