中文

大型语言模型在支持医学诊断与治疗中的性能

计算与语言 2025-04-15 v1 人工智能 新兴技术 人机交互

摘要

将大型语言模型(LLM)集成到医疗保健领域具有显著的潜力,有助于提高诊断准确性并支持医疗治疗计划。这些由人工智能驱动的系统能够分析海量数据,协助临床医生识别疾病、推荐治疗方案并预测患者预后。本研究评估了一系列当代大型语言模型的性能,包括开源模型和闭源模型,其在2024年葡萄牙国家医学 specialty 考试(PNA)上的表现,即该标准化医学知识评估。我们的结果显示,在准确率和成本效益方面存在显著差异,多个模型在该特定任务上表现超过了医学生的人类基准水平。我们确定了基于准确率和成本综合得分排名靠前的模型,讨论了类似链式思维(Chain-of-Thought)等推理方法的含义,并强调了大型语言模型作为辅助工具在复杂临床决策中为医疗专业人员提供支持的潜力。

关键词

引用

@article{arxiv.2504.10405,
  title  = {Performance of Large Language Models in Supporting Medical Diagnosis and Treatment},
  author = {Diogo Sousa and Guilherme Barbosa and Catarina Rocha and Dulce Oliveira},
  journal= {arXiv preprint arXiv:2504.10405},
  year   = {2025}
}

备注

21 pages, 6 figures, 4 tables. Acknowledgements: The authors acknowledge the support of the AITriage4SU Project (2024.07400.IACDC/2024), funded by the FCT (Foundation for Science and Technology), Portugal