中文

评估大语言模型在眼科学中的表现

计算与语言 2023-11-10 v1 人工智能

摘要

目的:评估并比较三种不同大语言模型(LLM)(GPT-3.5、GPT-4 和 PaLM2)回答眼科专业问题的表现,并与三类不同专业人群(医学本科生、医学硕士生和主治医师)进行比较。方法:分别对三种不同 LLM(GPT-3.5、GPT-4 和 PaLM2)和三种不同专业层级(医学本科生、医学硕士生和主治医师)进行 100 道眼科单选题测试。从平均分、稳定性和置信度方面综合评估 LLM 表现,并与人类组比较。结果:各 LLM 总体优于本科生,GPT-3.5 和 PaLM2 略低于硕士生水平,而 GPT-4 表现出与主治医师相当的水平。此外,GPT-4 的答题稳定性和置信度显著高于 GPT-3.5 和 PaLM2。结论:我们的研究表明,以 GPT-4 为代表的 LLM 在眼科领域表现更优。随着进一步改进,LLM 将在不久的将来为医学教育和临床决策带来意想不到的益处。

关键词

引用

@article{arxiv.2311.04933,
  title  = {Evaluating Large Language Models in Ophthalmology},
  author = {Jason Holmes and Shuyuan Ye and Yiwei Li and Shi-Nan Wu and Zhengliang Liu and Zihao Wu and Jinyu Hu and Huan Zhao and Xi Jiang and Wei Liu and Hong Wei and Jie Zou and Tianming Liu and Yi Shao},
  journal= {arXiv preprint arXiv:2311.04933},
  year   = {2023}
}