中文

爱丁堡临床NLP在MEDIQA-CORR 2024:用提示引导大语言模型

计算与语言 2024-05-29 v1 人工智能

摘要

MEDIQA-CORR 2024共享任务旨在评估大语言模型(LLM)识别和纠正临床笔记中医疗错误的能力。在本研究中,我们评估了通用LLM(特别是GPT-3.5和GPT-4)使用多种提示策略识别和纠正医疗错误的能力。认识到LLM仅通过提示策略生成准确纠正的局限性,我们提出以两种方式纳入来自较小微调模型的错误跨度预测:1)将其作为提示中的提示呈现;2)将其构建为多项选择题,LLM可以从中选择最佳纠正。我们发现,我们提出的提示策略显著提高了LLM生成纠正的能力。我们表现最佳的解决方案(8-shot + CoT + 提示)在共享任务排行榜上排名第六。此外,我们的综合分析显示了错误句子的位置、提示的角色以及多项选择选项的位置对LLM准确性的影响。这引发了关于LLM在真实临床环境中实施准备程度的进一步问题。

关键词

引用

@article{arxiv.2405.18028,
  title  = {Edinburgh Clinical NLP at MEDIQA-CORR 2024: Guiding Large Language Models with Hints},
  author = {Aryo Pradipta Gema and Chaeeun Lee and Pasquale Minervini and Luke Daines and T. Ian Simpson and Beatrice Alex},
  journal= {arXiv preprint arXiv:2405.18028},
  year   = {2024}
}