中文

面向医学问答的大语言模型微调综合研究:基于分类模型的比较分析

计算与语言 2025-01-30 v1

摘要

本文概述了开发和微调专为回答医学问题而设计的大型语言模型(LLM)的过程。我们主要改进了提供可靠医学查询答案的准确性和效率。在我们的方法中,我们有两个阶段:首先预测接收到的医学问题的特定标签,然后为该标签提供预定义的答案。我们考察了各种模型,如RoBERTa和BERT,并根据其能力进行评估。这些模型使用来自6800个样本(从Healthline.com爬取并添加合成数据)的数据集进行训练。对于评估,我们进行了基于5折交叉验证的比较研究。用于访问性能的指标包括准确率、精确率、召回率和F1分数,并记录了训练时间。模型的性能通过5折交叉验证进行评估。LoRA Roberta-large模型实现了78.47%的准确率、72.91%的精确率、76.95%的召回率和73.56%的F1分数。RoBERTa-base模型表现出高水平的性能,准确率达到99.87%,精确率达到99.81%,召回率达到99.86%,F1分数达到99.82%。BERT Uncased模型显示出强劲的成绩,准确率达到95.85%,精确率达到94.42%,召回率达到95.58%,F1分数达到94.72%。最后,BERT Large Uncased模型实现了最高的性能,准确率、精确率、召回率和F1分数均达到100%。获得的结果表明,这些模型在对医学问题进行分类并生成准确答案方面具有能力,这有助于制定改进的医疗相关AI解决方案。

关键词

引用

@article{arxiv.2501.17190,
  title  = {A Comprehensive Study on Fine-Tuning Large Language Models for Medical Question Answering Using Classification Models and Comparative Analysis},
  author = {Aysegul Ucar and Soumik Nayak and Anunak Roy and Burak Taşcı and Gülay Taşcı},
  journal= {arXiv preprint arXiv:2501.17190},
  year   = {2025}
}

备注

18 pages, 5 figures,3 tables