大语言模型的概率医学预测
人工智能
2024-12-05 v2
摘要
大语言模型(LLMs)通过提示工程在临床应用中展现出前景,允许灵活的临床预测。然而,它们难以生成可靠的预测概率,这对透明度和决策至关重要。虽然显式提示可以引导LLM生成概率估计,但其数值推理局限性引发了关于可靠性的担忧。我们将文本生成中的显式概率与从预测正确标签标记的似然推导出的隐式概率进行了比较。在六个先进开源LLM和五个医学数据集上,显式概率在区分度、精确度和召回率方面始终不如隐式概率。这种差异在较小的LLM和不平衡数据集上更为明显,强调了需要谨慎解读、改进概率估计方法以及进一步研究LLM的临床应用。
引用
@article{arxiv.2408.11316,
title = {Probabilistic Medical Predictions of Large Language Models},
author = {Bowen Gu and Rishi J. Desai and Kueiyu Joshua Lin and Jie Yang},
journal= {arXiv preprint arXiv:2408.11316},
year = {2024}
}
备注
Preprint. Under review