中文

BioMamba:领域自适应生物医学语言模型

计算与语言 2026-03-19 v2

摘要

背景:生物医学语言模型应在提升生物医学文本性能的同时保留通用领域语言能力。对于基于 Mamba 的模型,这一权衡在生物医学文献和临床文本中尚未得到充分研究。方法:本文开发了 BioMamba,一个生物医学模型系列,通过对公开 Mamba2 检查点在 PubMed 上进行持续预训练得到,同时包含少量来自 Colossal Clean Crawled Corpus(C4)和 Wikipedia 的通用领域数据,以帮助保留通用领域语言能力。本文在多个模型规模上评估了语言建模和三个下游任务:临床记录补全、出院总结生成和生物医学是非问答。结果:BioMamba 一致提升了 PubMed 建模性能,改善了 Wikipedia 建模性能,且 C4 性能基本保持不变。经过监督微调后,BioMamba 在生物医学文献和临床文本上均表现良好,在补全、摘要和问答任务上取得了强劲结果。在 MIMIC-IV 上,BioMamba+SFT 在记录补全和出院总结生成方面始终匹配或超越了来自相应基础检查点的 SFT。最强模型在 PubMed 困惑度上达到 5.28,在 BioASQ 和 PubMedQA 上的准确率分别为 90.24% 和 73.00%。结论:平衡的领域自适应预训练策略增强了 Mamba 语言模型在生物医学文献和临床文本中的性能,同时保留了通用领域语言能力,确立了 BioMamba 作为生物医学自然语言处理应用的实用基础。

关键词

引用

@article{arxiv.2408.02600,
  title  = {BioMamba: Domain-Adaptive Biomedical Language Models},
  author = {Ling Yue and Mingzhi Zhu and Sixue Xing and Shaowu Pan and Vijil Chenthamarakshan and Yanbo Wang and Yunning Cao and Payel Das and Tianfan Fu},
  journal= {arXiv preprint arXiv:2408.02600},
  year   = {2026}
}