中文

MedGPT-OSS:面向医学领域的通用视觉语言模型训练

计算与语言 2026-03-03 v1

摘要

医学多模态助手有望统一放射学、病理学和临床文本推理,但仍存在关键部署鸿沟:顶尖系统要么是闭源的,要么计算资源昂贵,导致无法实现患者隐私和PHI合规的本地部署。我们引入MEDGPT-OSS,一款开源权重、参数量为20B的通用视觉语言模型,旨在促进临床AI的开放研究。不同于依赖复杂架构,MEDGPT-OSS将GPT-oss语言主干与视觉前端通过优化的三阶段训练课程相结合。通过严格的数据 curated 与长上下文多模态对齐,逐步领域适配这些模块,我们展示了20B模型能够弥合规模差距。在跨分布式(out-of-distribution, OOD)多模态推理和复杂文本-only临床任务方面,MEDGPT-OSS成功超越了更大的开源医学模型。通过在单一指令跟随界面下统一多种模态,MEDGPT-OSS保持参数高效的存储 footprint,完全兼容常规 GPU。我们发布完整的训练配方、开源权重检查点以及严谨的评估 harness,为隐私保护、机构特定的临床AI研究提供可验证的基础。

关键词

引用

@article{arxiv.2603.00842,
  title  = {MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine},
  author = {Kai Zhang and Zhengqing Yuan and Cheng Peng and Songlin Zhao and Mengxian Lyu and Ziyi Chen and Yanfang Ye and Wei Liu and Ying Zhang and Kaleb E Smith and Lifang He and Lichao Sun and Yonghui Wu},
  journal= {arXiv preprint arXiv:2603.00842},
  year   = {2026}
}

备注

Technical report, work in progress