通过提示工程改进大语言模型用于临床命名实体识别
计算与语言
2024-01-26 v3
摘要
目的:本研究量化了 GPT-3.5 和 GPT-4 在临床命名实体识别(NER)任务中的能力,并提出了任务特定的提示以提升其性能。材料与方法:我们在两个临床 NER 任务上评估了这些模型:(1)按照 2010 i2b2 概念抽取共享任务,从 MTSamples 语料库的病历记录中抽取医疗问题、治疗和检查;(2)从疫苗不良事件报告系统(VAERS)的安全报告中识别神经系统疾病相关的不良事件。为提升 GPT 模型的性能,我们开发了临床任务特定的提示框架,包括(1)带有任务描述和格式规范的基线提示,(2)基于标注指南的提示,(3)基于错误分析的指令,以及(4)用于少样本学习的标注样本。我们评估了每个提示的有效性,并将这些模型与 BioClinicalBERT 进行比较。结果:使用基线提示时,GPT-3.5 和 GPT-4 在 MTSamples 上达到了 0.634、0.804 的宽松 F1 分数,在 VAERS 上达到了 0.301、0.593。额外的提示组件持续提升了模型性能。当使用全部四个组件时,GPT-3.5 和 GPT-4 在 MTSamples 上达到了 0.794、0.861 的宽松 F1 分数,在 VAERS 上达到了 0.676、0.736,证明了我们提示框架的有效性。尽管这些结果落后于 BioClinicalBERT(MTSamples 数据集 F1 为 0.901,VAERS 为 0.802),但考虑到仅需极少训练样本,这非常令人鼓舞。结论:虽然直接将 GPT 模型用于临床 NER 任务未能达到最优性能,但我们融合医学知识和训练样本的任务特定提示框架,显著增强了 GPT 模型在潜在临床应用中的可行性。
引用
@article{arxiv.2303.16416,
title = {Improving Large Language Models for Clinical Named Entity Recognition via Prompt Engineering},
author = {Yan Hu and Qingyu Chen and Jingcheng Du and Xueqing Peng and Vipina Kuttichi Keloth and Xu Zuo and Yujia Zhou and Zehan Li and Xiaoqian Jiang and Zhiyong Lu and Kirk Roberts and Hua Xu},
journal= {arXiv preprint arXiv:2303.16416},
year = {2024}
}
备注
17 pages, 5 tables, 6 figure