Fully Open Meditron:临床大语言模型的可审计管道
摘要
临床决策支持系统(CDSS)需要可审计的管道,以实现严格、可重复的验证。然而,当前基于大语言模型的CDSS仍大体不透明。大多数“开放”模型仅开放权重,发布参数而隐瞒数据来源、修订程序以及决定模型行为的生成管道。完全开放(FO)模型——即公开整个训练堆栈——目前在医学领域尚不存在。我们引入Fully Open Meditron,这是构建LLM-CDSS的首个完全开放管道,包括临床医生审核的训练语料库、可复现的数据构建与训练框架以及用以对齐的评估协议。该语料库将八个公共医学问答数据集整合为标准化对话格式,并通过三组临床医生审核的合成扩展内容进行覆盖扩展:考试风格问答、基于46,469项临床实践指南的指南导向问答,以及临床情景。管道强制执行系统范围的脱敏处理、教师生成的金标抽样以及由四名医生小组进行的端到端验证。我们采用LLM评判协议,对抄写的临床情景进行评估,并校准204名人类评审。我们将该配方应用于五个FO基础模型(Apertus-70B/8B-Instruct、OLMo-2-32B-SFT、EuroLLM-22B/9B-Instruct),所有MeditronFO变体均优于其基础模型。Apertus-70B-MeditronFO在整体医学基准测试中提升6.6分(从47.2%到53.8%),建立了新的FO SoTA。Gemma-3-27B-MeditronFO在58.6%的LLM评判比较中优于MedGemma,并在HealthBench上实现58% vs 55.9%的优势。这些结果表明,完全开放的管道能够在不牺牲可审计性和可重复性的前提下,实现领域特定的SOTA性能。
引用
@article{arxiv.2605.16215,
title = {Fully Open Meditron: An Auditable Pipeline for Clinical LLMs},
author = {Xavier Theimer-Lienhard and Mushtaha El-Amin and Fay Elhassan and Sahaj Vaidya and Victor Cartier-Negadi and David Sasu and Lars Klein and Mary-Anne Hartley},
journal= {arXiv preprint arXiv:2605.16215},
year = {2026}
}
备注
Preprint. 31 pages, 10 figures. Code, models, and data: https://github.com/EPFLiGHT/FullyOpenMeditron