大型语言模型能否逻辑预测心肌梗死?基于UK Biobank队列的评估
人工智能
2024-09-24 v1
摘要
背景:大型语言模型(LLM)在临床决策支持方面取得了非凡进展。然而,迫切需要高质量证据来评估LLM基于真实世界医疗数据提供准确临床决策的潜力与局限。目的:定量评估通用最先进LLM(ChatGPT和GPT-4)能否通过逻辑推理预测心肌梗死(MI)的发病风险,并进一步比较各种模型以全面评估LLM的性能。方法:在这项回顾性队列研究中,最初纳入了2006年至2010年从UK Biobank数据库招募的482,310名参与者,随后重采样得到690名参与者的最终队列。对于每位参与者,将MI风险因素的表格数据转换为标准化文本描述供ChatGPT识别。通过要求ChatGPT选择一个0到10的分数来代表风险以生成响应。使用思维链(CoT)提问来评估LLM是否进行逻辑预测。将ChatGPT的预测性能与已发表的医学指数、传统机器学习模型和其他大型语言模型进行了比较。结论:当前的LLM尚未准备好应用于临床医学领域。建议未来的医疗LLM应精通医疗领域知识,以理解自然语言和量化医疗数据,并进一步做出逻辑推理。
关键词
引用
@article{arxiv.2409.14478,
title = {Can Large Language Models Logically Predict Myocardial Infarction? Evaluation based on UK Biobank Cohort},
author = {Yuxing Zhi and Yuan Guo and Kai Yuan and Hesong Wang and Heng Xu and Haina Yao and Albert C Yang and Guangrui Huang and Yuping Duan},
journal= {arXiv preprint arXiv:2409.14478},
year = {2024}
}