中文

持续预训练能否弥合医学领域通用与专用语言模型之间的性能差距?

计算与语言 2026-04-22 v1

摘要

本文通过持续预训练和合并进行领域适应,缩小了小型专用模型与显著更大的通用模型之间的性能差距。我们通过从 FineWeb2 构建高质量的德语医学语料库(FineMed-de),解决了专用非英语数据的稀缺问题。该语料库用于持续预训练和合并三个知名的 LLM(参数量从 7B7B24B24B),创建了 DeFineMed 模型系列。综合评估证实,专业化显著提升了 7B7B 模型在德语医学基准上的性能。此外,基于 Qwen2.5 的模型的成对胜率分析表明,通过领域适应,其对抗大得多的 Mistral-Small-24B-Instruct 的胜率提升了约 3.53.5 倍。这一证据将专用的 7B7B 模型定位为用于复杂医学指令遵循任务的具有竞争力且资源高效的解决方案。虽然模型合并成功恢复了指令遵循能力,但随后的失败模式分析揭示了固有的权衡,包括引入语言混合和冗长度的增加,突出了未来工作中需要更有针对性的微调。本研究为开发专用 LLM 提供了稳健、合规的方法论,为德语区医疗保健语境中的实际应用奠定了基础。

关键词

引用

@article{arxiv.2604.19394,
  title  = {Can Continual Pre-training Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?},
  author = {Niclas Doll and Jasper Schulze Buschhoff and Shalaka Satheesh and Hammam Abdelwahab and Héctor Allende-Cid and Katrin Klug},
  journal= {arXiv preprint arXiv:2604.19394},
  year   = {2026}
}

备注

Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, San Diego, California, July 2 - 7, 2026) as a main conference paper