中文

用于临床风险预测的大语言模型

计算与语言 2024-09-17 v1

摘要

本研究比较了 GPT-4 与 clinalytix Medical AI 在预测谵妄发生临床风险方面的效能。结果表明,GPT-4 在识别阳性病例方面表现出显著缺陷,且难以提供可靠的谵妄风险概率估计,而 clinalytix Medical AI 表现出更高的准确性。对大语言模型 (LLM) 输出的详尽分析阐明了这些差异的潜在原因,这与现有文献中报告的局限性相一致。这些结果凸显了 LLM 在准确诊断病情和解释复杂临床数据方面面临的挑战。尽管 LLM 在医疗保健领域具有巨大潜力,但目前尚不适合独立的临床决策。相反,它们应被用于辅助角色,以补充临床专业知识。持续的人类监督对于确保患者和医疗保健提供者获得最佳结果仍然至关重要。

关键词

引用

@article{arxiv.2409.10191,
  title  = {LLMs for clinical risk prediction},
  author = {Mohamed Rezk and Patricia Cabanillas Silva and Fried-Michael Dahlweid},
  journal= {arXiv preprint arXiv:2409.10191},
  year   = {2024}
}