利用大语言模型识别与抽取罕见病表型
计算与语言
2024-06-28 v1 人工智能
摘要
罕见病(RDs)总体常见,影响全球3亿人。准确的表型刻画对于指导诊断和治疗至关重要,但罕见病表型常嵌入非结构化文本中,人工抽取耗时费力。虽然自然语言处理(NLP)模型可通过命名实体识别(NER)实现自动抽取,但主要瓶颈在于开发用于模型训练的大规模标注语料库。近来,提示学习作为一种NLP范式兴起,可在无标注样本(零样本)或少量标注样本(少样本)下获得更具泛化性的结果。尽管ChatGPT这一能够遵循复杂人类提示并生成高质量回复的革命性大语言模型日益受到关注,尚无研究考察其在零样本和少样本设置下针对罕见病的NER表现。为此,我们设计了用于抽取罕见病表型的新颖提示,并且据我们所知,首次建立了评估ChatGPT在这些设置下表现的基准。我们将其性能与传统微调方法比较并开展了深入的错误分析。总体而言,微调BioClinicalBERT取得了更高性能(F1为0.689),优于ChatGPT(零样本和少样本F1分别为0.472和0.591)。尽管如此,ChatGPT在单样本设置下对特定实体(即罕见病和体征)达到了相似或更高的准确率(F1为0.776和0.725)。这表明通过恰当的提示工程,ChatGPT有望仅借助一个标注样本即可匹配或超越微调语言模型在特定实体类型上的表现。尽管大语言模型的涌现可能为支持罕见病诊疗带来机遇,研究人员与临床医生仍应批判性地评估模型输出并充分了解其局限。
引用
@article{arxiv.2306.12656,
title = {Identifying and Extracting Rare Disease Phenotypes with Large Language Models},
author = {Cathy Shyr and Yan Hu and Paul A. Harris and Hua Xu},
journal= {arXiv preprint arXiv:2306.12656},
year = {2024}
}