中文

面向疾病预测的多层大语言模型框架下的集成分类方法

计算与语言 2025-09-03 v1 机器学习

摘要

社交远程诊疗在医疗保健领域取得了显著进展,使患者能够远程发布症状并参与医疗咨询。用户经常在社交媒体和在线健康平台上发布症状,形成了可以用于疾病分类的巨大医学数据储存库。大语言模型(如LLAMA3和GPT-3.5)以及基于Transformer的模型如BERT在处理复杂医学文本方面表现出强大的能力。本研究评估了三种阿拉伯语医学文本预处理方法,如摘要化、精炼和命名实体识别(NER),然后应用针对性的阿拉伯语Transformer模型(CAMeLBERT、AraBERT和AsafayaBERT)。为提高鲁棒性,我们采用多数投票集成,将来自原始和预处理文本表示的预测组合在一起。该方法实现了最佳的80.56%分类准确率,从而显示其在利用各种文本表示和模型预测以提高对医学文本理解方面的有效性。鉴于本文是首次将LLM-based预处理与针对性的阿拉伯语Transformer模型和集成学习结合用于阿拉伯语社交远程诊疗数据的疾病分类,我们深知本工作的独特性。

关键词

引用

@article{arxiv.2509.02446,
  title  = {An Ensemble Classification Approach in A Multi-Layered Large Language Model Framework for Disease Prediction},
  author = {Ali Hamdi and Malak Mohamed and Rokaia Emad and Khaled Shaban},
  journal= {arXiv preprint arXiv:2509.02446},
  year   = {2025}
}