ChatGPT 生成医学回答的评估:系统综述与荟萃分析
统计方法学
2024-03-12 v1 机器学习
摘要
诸如 ChatGPT 之类的大语言模型(LLM)在医学领域中的探索日益增多。然而,缺乏性能评估的标准指南导致了方法学上的不一致。本研究旨在总结评估 ChatGPT 在医学中表现的现有证据,并为未来研究提供方向。我们于 2023 年 6 月 15 日使用关键词“ChatGPT”检索了十个医学文献数据库。共识别出 3520 篇文章,其中 60 篇在本论文中被审阅总结,17 篇被纳入荟萃分析。分析显示,ChatGPT 在应对医学查询时的总体综合准确率为 56%(95% CI:51%–60%,I2 = 87%)。然而,各研究在问题来源、提问过程及评估指标方面存在差异。此外,许多研究未能报告方法学细节,包括 ChatGPT 的版本以及每个问题是独立使用还是重复使用。我们的发现揭示,尽管 ChatGPT 在医疗健康中展现出可观的应用潜力,但研究的异质性与报告的不充分可能影响这些结果的可靠性。需要进一步的精心设计且报告全面透明的研究来评估 ChatGPT 在医学中的表现。
引用
@article{arxiv.2310.08410,
title = {Evaluation of ChatGPT-Generated Medical Responses: A Systematic Review and Meta-Analysis},
author = {Qiuhong Wei and Zhengxiong Yao and Ying Cui and Bo Wei and Zhezhen Jin and Ximing Xu},
journal= {arXiv preprint arXiv:2310.08410},
year = {2024}
}