中文

在小型医学数据集上进行 LLM 微调:心脏病报告和出院记录中的文本分类与标准化效果

计算与语言 2025-03-28 v1 机器学习

摘要

我们研究了在小型医学数据集上对大语言模型(LLM)进行微调,以应对文本分类和命名实体识别任务的效果。使用德国心脏病报告数据集和 i2b2 Smoking Challenge 数据集,我们证明了在有限训练数据上对小型 LLM 进行本地化微调可以提升性能,达到与大型模型相当的效果。我们的实验表明,微调在两项任务上都能显著提升性能,仅需 200-300 个训练样本即可观察到显著 gains。总体而言,本研究凸显了针对临床工作流程进行任务特定微调的潜力,能够高效地从非结构化医学文本中提取结构化数据。

关键词

引用

@article{arxiv.2503.21349,
  title  = {Fine-Tuning LLMs on Small Medical Datasets: Text Classification and Normalization Effectiveness on Cardiology reports and Discharge records},
  author = {Noah Losch and Lucas Plagwitz and Antonius Büscher and Julian Varghese},
  journal= {arXiv preprint arXiv:2503.21349},
  year   = {2025}
}

备注

4 pages, 2 tables,