评估开源大型语言模型在医疗文本分类任务中的性能
计算与语言
2025-05-09 v2 人工智能
摘要
将大型语言模型(LLMs)应用于医疗信息抽取已成为一个有前景的方向。本研究评估了五个开源大型语言模型(GEMMA-3-27B-IT、LLAMA3-70B、LLAMA4-109B、DEEPSEEK-R1-DISTILL-LLAMA-70B和DEEPSEEK-V3-0324-UD-Q2_K_XL)在六个医疗相关分类任务中的分类性能,这些任务涉及社交媒体数据(乳腺癌、用药方案变更、妊娠并发症、潜在COVID-19病例)和临床数据(污名化标签、用药变更讨论)。我们报告了所有模型-任务组合的精确率、召回率和F1分数,并给出95%置信区间。我们的发现表明,不同LLM之间存在显著的性能差异,其中DeepSeekV3作为总体表现最佳的模型,在四个任务中取得了最高的F1分数。值得注意的是,模型在社交媒体任务上的总体表现优于临床数据任务,这表明存在特定于领域的挑战。GEMMA-3-27B-IT尽管参数量较小,却在召回率方面表现出色;而LLAMA4-109B的表现出人意料地低于其前身LLAMA3-70B,这表明更大的参数量并不一定保证更好的分类结果。我们观察到不同模型之间存在明显的精确率-召回率权衡,其中一些模型倾向于提高灵敏度,而另一些则倾向于提高特异度。这些发现突显了在医疗应用中考虑特定数据领域和精确率-召回率要求进行任务特定模型选择的重要性,而不是仅仅考虑模型规模。随着医疗领域越来越多地集成AI驱动的文本分类工具,本综合基准测试为模型选择和实施提供了有价值的指导,同时也凸显了在医疗语境下持续评估和领域适配大型语言模型的必要性。
引用
@article{arxiv.2503.15169,
title = {Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks},
author = {Yuting Guo and Abeed Sarker},
journal= {arXiv preprint arXiv:2503.15169},
year = {2025}
}
备注
5 pages