中文

基于ChatGPT的医学数据增强:以药物识别与用药事件分类为例

计算与语言 2023-06-14 v1 人工智能 机器学习

摘要

在电子健康记录与临床笔记中识别药物、疾病及关系等关键因素在临床领域具有广泛应用。在N2C2 2022竞赛中,为推进利用情境化用药事件数据集(CMED)识别电子健康记录(EHRs)中的关键因素,提出了多项任务。预训练大语言模型(LLMs)在这些任务中展现出卓越性能。本研究旨在探索利用LLMs(具体而言ChatGPT)进行数据增强,以克服EHRs关键因素标注数据有限的困境。此外,采用最初在维基百科与MIMIC等大规模数据集上训练的多种预训练BERT模型,通过在增强数据集上微调来构建EHRs中这些关键变量的识别模型。两项EHR分析任务(即药物识别与用药事件分类)的实验结果表明,基于ChatGPT的数据增强确实有益于提升药物识别与用药事件分类的性能。

关键词

引用

@article{arxiv.2306.07297,
  title  = {Medical Data Augmentation via ChatGPT: A Case Study on Medication Identification and Medication Event Classification},
  author = {Shouvon Sarker and Lijun Qian and Xishuang Dong},
  journal= {arXiv preprint arXiv:2306.07297},
  year   = {2023}
}