基于LLM的眼科患者查询医学型大语言模型聊天机器人临床验证
人工智能
2026-02-06 v1
摘要
领域特定的大语言模型日益增多,用于支持患者教育、分诊和临床决策在眼科领域得到应用,因而对其安全性和准确性进行严格评估至关重要。本研究评估了四个小型医学LLM(Meerkat-7B、BioMistral-7B、OpenBioLLM-8B、MedLLaMA3-v20)在回答与眼科相关患者查询方面的能力,并评估了基于LLM的评估方法是否可行,以对比临床医生的评分。在本�断断面研究中,对180个眼科患者查询由每个模型分别生成2160个回答。选取参数规模在100亿以下的模型,以实现资源高效部署。回答由三位不同资历的眼科医生以及GPT-4-Turbo根据S.C.O.R.E.框架进行评估,该框架评估安全性、共识性和情境、客观性、可重复性和可解释性,并采用5分量表给出评分。采用斯皮尔曼等级相关系数、肯德尔tau统计量和核密度估计分析LLM与临床医生评分之间的一致性。Meerkat-7B取得最佳表现,分别来自资深顾问、顾问和住院医师的平均分为3.44、4.08和4.18。MedLLaMA3-v20表现最差,其中25.5%的回答包含幻觉或临床上误导性内容,包括虚构术语。GPT-4-Turbo评分整体与临床医生评估显示出强烈一致性,斯皮尔曼rho为0.80,肯德尔tau为0.67,尽管资深顾问的评分较为保守。总体而言,医学LLM在安全的眼科问答方面展现出潜力,但在临床深度和共识性方面仍存在不足,支持基于LLM的评估可行用于大规模基准测试,并需要混合自动化和临床医生审核框架以指导安全的临床部署。
引用
@article{arxiv.2602.05381,
title = {Clinical Validation of Medical-based Large Language Model Chatbots on Ophthalmic Patient Queries with LLM-based Evaluation},
author = {Ting Fang Tan and Kabilan Elangovan and Andreas Pollreisz and Kevin Bryan Dy and Wei Yan Ng and Joy Le Yi Wong and Jin Liyuan and Chrystie Quek Wan Ning and Ashley Shuen Ying Hong and Arun James Thirunavukarasu and Shelley Yin-His Chang and Jie Yao and Dylan Hong and Wang Zhaoran and Amrita Gupta and Daniel SW Ting},
journal= {arXiv preprint arXiv:2602.05381},
year = {2026}
}