中文

使用ChatGPT或GPT-4等大型语言模型作为临床助理的潜力与隐患

计算与语言 2023-07-18 v1

摘要

近期研究已展示 ChatGPT 与 GPT-4 在若干医学领域任务上的良好表现。然而,尚无研究使用大规模真实世界电子健康记录数据库评估其性能,也未评估其在为全谱系疾病表现患者提供临床诊断辅助方面的效用。我们使用 ChatGPT 与 GPT-4 进行了两项分析:其一,利用真实世界大型电子健康记录数据库识别患有特定医学诊断的患者;其二,在前瞻性评估假设患者时为医护人员提供诊断辅助。我们的结果显示,GPT-4 在结合思维链与少样本提示的疾病分类任务上可达到高达 96% F1 分数的性能。在患者评估中,GPT-4 四次中有三次能准确诊断。然而,也存在事实性错误陈述、忽略关键医学发现、建议不必要检查与过度治疗的情况。这些问题加之隐私顾虑,使这些模型目前不足以用于真实世界临床实践。不过,与传统机器学习工作流配置相比,提示工程所需的数据与时间为有限,凸显了其在医疗应用中可扩展的潜力。

关键词

引用

@article{arxiv.2307.08152,
  title  = {The Potential and Pitfalls of using a Large Language Model such as ChatGPT or GPT-4 as a Clinical Assistant},
  author = {Jingqing Zhang and Kai Sun and Akshay Jagadeesh and Mahta Ghahfarokhi and Deepa Gupta and Ashok Gupta and Vibhor Gupta and Yike Guo},
  journal= {arXiv preprint arXiv:2307.08152},
  year   = {2023}
}

备注

This manuscript is pre-print and in peer review. Supplementary materials will be published later