中文

多种大语言模型在小儿眼科中的评估

计算与语言 2023-11-09 v1

摘要

重要性 不同大语言模型(LLMs)与包括医学生、研究生及执业医生在内的各类个体在小儿眼科咨询中的回答有效性尚未明确确立。目的 设计一套基于小儿眼科的 100 题考试,以评估 LLMs 在高度专业化场景中的表现,并与不同层级医学生和医生的表现进行比较。设计、设置与参与者 本调查研究评估了三种 LLMs,即 ChatGPT(GPT-3.5)、GPT-4 和 PaLM2,以及三类人类群体:医学生、研究生和主治医师,评估其回答小儿眼科相关问题的能力。研究通过 LLM 网络接口以试卷形式发放问卷,并有志愿者宝贵参与。主要结果和措施 LLM 与人类在 100 道多选题上的平均得分,以及各 LLM 的回答稳定性、相关性与回答置信度。结果 GPT-4 表现与主治医师相当,而 ChatGPT(GPT-3.5)和 PaLM2 优于医学生但略逊于研究生。此外,相较 ChatGPT(GPT-3.5)和 PaLM2,GPT-4 在应答时表现出更高的稳定性与置信度。结论与相关意义 我们的结果凸显了 LLMs 在小儿眼科提供医疗辅助的潜力,并暗示其在指导医学生教育方面具有显著能力。

关键词

引用

@article{arxiv.2311.04368,
  title  = {Evaluating multiple large language models in pediatric ophthalmology},
  author = {Jason Holmes and Rui Peng and Yiwei Li and Jinyu Hu and Zhengliang Liu and Zihao Wu and Huan Zhao and Xi Jiang and Wei Liu and Hong Wei and Jie Zou and Tianming Liu and Yi Shao},
  journal= {arXiv preprint arXiv:2311.04368},
  year   = {2023}
}

备注

6 figures, 1 table