Edinburgh Clinical NLP at MEDIQA-CORR 2024: 用提示词指导大语言模型
计算与语言
2024-05-29 v1
摘要
MEDIQA-CORR 2024 分组任务旨在评估大语言模型 (LLM) 在临床笔记中识别和纠正医学错误的能力。在本研究中,我们评估了通用 LLM(具体为 GPT-3.5 和 GPT-4)识别和纠正医学错误的能力,并采用了多种提示策略。鉴于 LLM 仅通过提示策略生成准确纠正的局限性,我们提出了两种将小型微调模型的错误-span 预测纳入提示中的方法:1) 将其作为提示中的提示词呈现,以及2) 将其建模为从中选择最佳纠正选项的多选问答。我们发现,我们提出的提示策略显著提高了 LLM 生成纠正的能力。我们的最佳表现方案采用 8-shot + CoT + 提示词,在分组任务排行榜上位列第六。此外,我们的全面分析显示,错误句子位置、提示角色以及多选选项位置对 LLM 准确率都有显著影响。这进一步提出了关于 LLM 在实际临床环境中就绪性的问题。
关键词
引用
@article{arxiv.2405.18027,
title = {TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models},
author = {Jaewoo Ahn and Taehyun Lee and Junyoung Lim and Jin-Hwa Kim and Sangdoo Yun and Hwaran Lee and Gunhee Kim},
journal= {arXiv preprint arXiv:2405.18027},
year = {2024}
}
备注
ACL 2024 Findings. Code and dataset are released at https://ahnjaewoo.github.io/timechara