GPT-4 基于 USMLE 案例研究的自我性能评估
人工智能
2024-03-28 v2 计算与语言
人机交互
多智能体系统
机器学习
摘要
本研究调查了 GPT-4 在医疗应用中对自身性能的评估。采用一种简单的提示技术,向大语言模型(LLM)提出取自美国医师执照考试(USMLE)问卷的问题,并要求其在提问前和提问后评估其置信度分数。问卷分为两组:问题后带反馈(WF)和问题后无反馈(NF)。模型被要求在每道题前后提供绝对和相对置信度分数。实验结果利用统计工具进行分析,以研究 WF 和 NF 组中置信度的变异性。此外,还进行了序列分析,以观察 WF 和 NF 组的性能变化。结果表明,反馈会影响相对置信度,但并不会一致地使其增加或减少。了解 LLM 的性能对于探索其在医疗等敏感领域的效用至关重要。本研究有助于关于 AI(特别是 GPT-4 等 LLM)在医疗领域可靠性的持续讨论,并为如何优化反馈机制以增强 AI 辅助医学教育和决策支持提供了见解。
引用
@article{arxiv.2402.09654,
title = {GPT-4's assessment of its performance in a USMLE-based case study},
author = {Uttam Dhakal and Aniket Kumar Singh and Suman Devkota and Yogesh Sapkota and Bishal Lamichhane and Suprinsa Paudyal and Chandra Dhakal},
journal= {arXiv preprint arXiv:2402.09654},
year = {2024}
}