QUAD-LLM-MLTC:大型语言模型集成学习用于医疗文本多标签分类
计算与语言
2025-03-04 v2
摘要
收集的医疗文本数据量不断增加,带来了自动多标签文本分类(MLTC)的独特挑战,主要由于训练数据的稀缺及其细腻的特性。传统机器学习模型往往无法充分捕捉表达话题的多样性。然而,大型语言模型(LLM)在诸多自然语言处理(NLP)任务中展现出惊人的有效性,这些模型在计算效率和通过提示工程实现无监督学习方面表现出色。因此,这些LLM为医疗叙述的MLTC提供了有效的解决方案。然而,在处理各种标签时, Depending on the topic, different prompts may be relevant. 为此,提出的方法QUAD-LLM-MLTC利用四个LLM(GPT-4o、BERT、PEGASUS和BART)的优势。QUAD-LLM-MLTC以顺序管道运行,其中BERT提取关键词,PEGASUS增强文本数据,GPT-4o进行分类,BART提供主题分配概率, resulting in four classifications in a 0-shot setting. 这些输出随后通过集成学习组合,并通过元分类器生成最终的MLTC结果。该方法使用三个标注文本样本进行评估,与传统和单模型方法进行对比。结果在大多数主题的F1分数和一致性(F1和Micro-F1分数分别为78.17%和80.16%,标准差分别为0.025和0.011)中显示出显著的改进。这一研究推进了使用LLM的MLTC,提供了一个高效且可扩展的解决方案,用于快速而无需额外训练地对医疗相关文本数据进行分类。
引用
@article{arxiv.2502.14189,
title = {QUAD-LLM-MLTC: Large Language Models Ensemble Learning for Healthcare Text Multi-Label Classification},
author = {Hajar Sakai and Sarah S. Lam},
journal= {arXiv preprint arXiv:2502.14189},
year = {2025}
}