中文

提示工程并未在临床决策任务中全面提升大型语言模型性能

计算与语言 2025-12-30 v1

摘要

大型语言模型在医学知识评估中展现了潜力,但其在真实世界临床决策中的实际效用仍有待探索。在本研究中,我们评估了三种最先进的 LLM——ChatGPT-4o、Gemini 1.5 Pro 和 Llama 3.3 70B——在典型患者就诊的整个临床推理流程中的临床决策支持表现。利用 36 个病例研究,我们首先在两种温度设置(默认与零度)下,评估了 LLM 在五个关键连续临床决策任务中的开箱即用性能:鉴别诊断、关键紧急步骤、相关诊断检查、最终诊断和治疗建议。所有模型在不同任务上的表现差异很大,在最终诊断中达到了近乎完美的准确率,在相关诊断检查中表现较差,在其余任务中表现中等。此外,ChatGPT 在零温度下表现更好,而 Llama 在默认温度下表现更强。接下来,我们通过应用 MedPrompt 框架的变体,结合目标动态与随机少样本学习,评估了提示工程是否能提升 LLM 的性能。结果表明,提示工程并非一刀切的解决方案。虽然它显著提高了基线准确率最低的任务(相关诊断检查)的性能,但对其他任务却产生了负面影响。另一个关键发现是,目标动态少样本提示并未始终优于随机选择,这表明紧密匹配示例的预期优势可能会被更广泛上下文多样性的丧失所抵消。这些发现表明,提示工程的影响高度依赖于模型和任务,凸显了将 LLM 整合到医疗保健中需要量身定制、具备上下文感知的策略。

关键词

引用

@article{arxiv.2512.22966,
  title  = {Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks},
  author = {Mengdi Chai and Ali R. Zomorrodi},
  journal= {arXiv preprint arXiv:2512.22966},
  year   = {2025}
}